Scalaのリファクタリングに関するアドバイス-foreachループで使用されている変数を削除できますか

debugcn 投稿 Dev

ジャミエット

Scalaコードをリファクタリングして、よりエレガントで慣用的なScalaにする方法についてのアドバイスを探しています。

機能があります

def joinDataFramesOnColumns(joinColumns: Seq[String]) : org.apache.spark.sql.DataFrame

でSeq[org.apache.spark.sql.DataFrame]それらを結合することにより、で動作しますjoinColumns。関数の定義は次のとおりです。

implicit class SequenceOfDataFrames(dataFrames: Seq[DataFrame]){
    def joinDataFramesOnColumns(joinColumns: Seq[String]) : DataFrame = {
      val emptyDataFrame = SparkSession.builder().getOrCreate().emptyDataFrame
      val nonEmptyDataFrames = dataFrames.filter(_ != emptyDataFrame)
      if (nonEmptyDataFrames.isEmpty){
        emptyDataFrame
      }
      else {
        if (joinColumns.isEmpty) {
          return nonEmptyDataFrames.reduce(_.crossJoin(_))
        }
      nonEmptyDataFrames.reduce(_.join(_, joinColumns))
    }
  }
}

すべて成功するユニットテストがいくつかあります。

class FeatureGeneratorDataFrameExtensionsTest extends WordSpec {
  val fruitValues = Seq(
    Row(0, "BasketA", "Bananas", "Jack"),
    Row(2, "BasketB", "Oranges", "Jack"),
    Row(2, "BasketC", "Oranges", "Jill"),
    Row(3, "BasketD", "Oranges", "Jack"),
    Row(4, "BasketE", "Oranges", "Jack"),
    Row(4, "BasketE", "Apples", "Jack"),
    Row(4, "BasketF", "Bananas", "Jill")
  )
  val schema = List(
    StructField("weeksPrior", IntegerType, true),
    StructField("basket", StringType, true),
    StructField("Product", StringType, true),
    StructField("Customer", StringType, true)
  )
  val fruitDf = spark.createDataFrame(
    spark.sparkContext.parallelize(fruitValues),
    StructType(schema)
  ).withColumn("Date", udfDateSubWeeks(lit(dayPriorToAsAt), col("weeksPrior")))

  "FeatureGenerator.SequenceOfDataFrames" should {
    "join multiple dataframes on a specified set of columns" in {
      val sequenceOfDataFrames = Seq[DataFrame](
        fruitDf.withColumnRenamed("weeksPrior", "weeksPrior1"),
        fruitDf.withColumnRenamed("weeksPrior", "weeksPrior2"),
        fruitDf.withColumnRenamed("weeksPrior", "weeksPrior3"),
        fruitDf.withColumnRenamed("weeksPrior", "weeksPrior4"),
        fruitDf.withColumnRenamed("weeksPrior", "weeksPrior5")
      )
      val joinedDataFrames = sequenceOfDataFrames.joinDataFramesOnColumns(Seq("basket", "Product", "Customer", "Date"))
      assert(joinedDataFrames.columns.length === 9)
      assert(joinedDataFrames.columns.contains("basket"))
      assert(joinedDataFrames.columns.contains("Product"))
      assert(joinedDataFrames.columns.contains("Customer"))
      assert(joinedDataFrames.columns.contains("Date"))
      assert(joinedDataFrames.columns.contains("weeksPrior1"))
      assert(joinedDataFrames.columns.contains("weeksPrior2"))
      assert(joinedDataFrames.columns.contains("weeksPrior3"))
      assert(joinedDataFrames.columns.contains("weeksPrior4"))
      assert(joinedDataFrames.columns.contains("weeksPrior5"))
    }
    "when passed a list of one dataframe return that same dataframe" in {
      val sequenceOfDataFrames = Seq[DataFrame](fruitDf)
      val joinedDataFrame = sequenceOfDataFrames.joinDataFramesOnColumns(Seq("basket", "Product"))
      assert(joinedDataFrame.columns.sorted === fruitDf.columns.sorted)
      assert(joinedDataFrame.count === fruitDf.count)
    }
    "when passed an empty list of dataframes return an empty dataframe" in {
      val joinedDataFrame = Seq[DataFrame]().joinDataFramesOnColumns(Seq("basket"))
      assert(joinedDataFrame === spark.emptyDataFrame)
    }
    "when passed an empty list of joinColumns return the dataframes crossjoined" in {
      val sequenceOfDataFrames = Seq[DataFrame](fruitDf,fruitDf, fruitDf)
      val joinedDataFrame = sequenceOfDataFrames.joinDataFramesOnColumns(Seq[String]())
      assert(joinedDataFrame.count === scala.math.pow(fruitDf.count, sequenceOfDataFrames.size))
      assert(joinedDataFrame.columns.size === fruitDf.columns.size * sequenceOfDataFrames.size)
    }
  }
}

このSparkバグが原因でエラーが発生するまで、これはすべて正常に機能していました：https：//issues.apache.org/jira/browse/SPARK-25150これは、結合列が同じ名前の場合、特定の条件下でエラーを引き起こす可能性があります。

回避策は、列を別のものとしてエイリアスすることです。そのため、結合列をエイリアスし、結合を実行してから、名前を元に戻すように関数を書き直しました。

  implicit class SequenceOfDataFrames(dataFrames: Seq[DataFrame]){
    def joinDataFramesOnColumns(joinColumns: Seq[String]) : DataFrame = {
      val emptyDataFrame = SparkSession.builder().getOrCreate().emptyDataFrame
      val nonEmptyDataFrames = dataFrames.filter(_ != emptyDataFrame)
      if (nonEmptyDataFrames.isEmpty){
        emptyDataFrame
      }
      else {
        if (joinColumns.isEmpty) {
          return nonEmptyDataFrames.reduce(_.crossJoin(_))
        }

      /*
      The horrible, gnarly, unelegent code below  would ideally exist simply as:

      nonEmptyDataFrames.reduce(_.join(_, joinColumns))

      however that will fail in certain specific circumstances due to a bug in spark,
      see https://issues.apache.org/jira/browse/SPARK-25150 for details
       */
      val aliasSuffix = "_aliased"
      val aliasedJoinColumns = joinColumns.map(joinColumn => joinColumn+aliasSuffix)
      var aliasedNonEmptyDataFrames: Seq[DataFrame] = Seq()
      nonEmptyDataFrames.foreach(
        nonEmptyDataFrame =>{
          var tempNonEmptyDataFrame = nonEmptyDataFrame
          joinColumns.foreach(
            joinColumn => {
              tempNonEmptyDataFrame = tempNonEmptyDataFrame.withColumnRenamed(joinColumn, joinColumn+aliasSuffix)
            }
          )
          aliasedNonEmptyDataFrames = aliasedNonEmptyDataFrames :+ tempNonEmptyDataFrame
        }
      )
      var joinedAliasedNonEmptyDataFrames = aliasedNonEmptyDataFrames.reduce(_.join(_, aliasedJoinColumns))
      joinColumns.foreach(
        joinColumn => joinedAliasedNonEmptyDataFrames = joinedAliasedNonEmptyDataFrames.withColumnRenamed(
          joinColumn+aliasSuffix, joinColumn
        )
      )
      joinedAliasedNonEmptyDataFrames
    }
  }
}

テストはまだ合格しているので、かなり満足していvarますがvar、各反復で結果をそれに戻すループを調べています...特に元のテストと比較して、かなりエレガントではなく、醜いです関数のバージョン。varsを使わなくてもいいように書く方法があるはずなのに、試行錯誤の末、これが一番いいと思います。

誰かがよりエレガントな解決策を提案できますか？初心者のScala開発者として、このような問題を解決する慣用的な方法に慣れることは本当に助けになります。

コードの残りの部分（テストなど）に関する建設的なコメントも歓迎します

ジャミエット

foldLeft（）の使用を提案してくれた@Duelistに感謝します。ScalaのfoldLeftはDataFrameでどのように機能しますか？これにより、コードをそのように適合させて、varsを排除することになりました。

  implicit class SequenceOfDataFrames(dataFrames: Seq[DataFrame]){
    def joinDataFramesOnColumns(joinColumns: Seq[String]) : DataFrame = {
      val emptyDataFrame = SparkSession.builder().getOrCreate().emptyDataFrame
      val nonEmptyDataFrames = dataFrames.filter(_ != emptyDataFrame)
      if (nonEmptyDataFrames.isEmpty){
        emptyDataFrame
      }
      else {
        if (joinColumns.isEmpty) {
          return nonEmptyDataFrames.reduce(_.crossJoin(_))
        }

        /*
        The code below  would ideally exist simply as:

        nonEmptyDataFrames.reduce(_.join(_, joinColumns))

        however that will fail in certain specific circumstances due to a bug in spark,
        see https://issues.apache.org/jira/browse/SPARK-25150 for details

        hence this code aliases the joinColumns, performs the join, then renames the 
        aliased columns back to their original name
         */
        val aliasSuffix = "_aliased"
        val aliasedJoinColumns = joinColumns.map(joinColumn => joinColumn+aliasSuffix)
        val joinedAliasedNonEmptyDataFrames = nonEmptyDataFrames.foldLeft(Seq[DataFrame]()){
          (tempDf, nonEmptyDataFrame) => tempDf :+ joinColumns.foldLeft(nonEmptyDataFrame){
            (tempDf2, joinColumn) => tempDf2.withColumnRenamed(joinColumn, joinColumn+aliasSuffix)
          }
        }.reduce(_.join(_, aliasedJoinColumns))
        joinColumns.foldLeft(joinedAliasedNonEmptyDataFrames){
          (tempDf, joinColumn) => tempDf.withColumnRenamed(joinColumn+aliasSuffix, joinColumn)
        }
      }
    }
  }

2つのステートメントを1つにまとめて削除することでさらに進めることができましたがval joinedAliasedNonEmptyDataFrames、その暫定的な使用によってもたらされる明確さを好みましたval。

この記事はインターネットから収集されたものであり、転載の際にはソースを示してください。

侵害の場合は、連絡してください[email protected]

編集2021-06-12

コメントを追加

サインイン

分類Dev

Related 関連記事

記事

Scalaのリファクタリングに関するアドバイス-foreachループで使用されている変数を削除できますか

Scalaのリファクタリングに関するアドバイス-foreachループで使用されている変数を削除できますか

レガシーコードをリファクタリングするために必要なアドバイス

静的ファクトリーメソッドでオーバーライドされたメソッドでインスタンスを作成するときに、囲んでいるクラスのプライベートフィールドにアクセスするにはどうすればよいですか？

PHPコードを「コンパイル」して、バイトコードインタープリターによって実行されるバイナリ風のファイルをアップロードできますか？

サーバーとクライアントの両方でブロックすることなく、サーバーでリアルタイムに書き込まれているアップロードされたファイルのファイルサイズを読み取ってエコーする方法は？

tornadofxアプリ内のobservableArrayListにバインドされたアイテムのフィルタリングを可能にするためにビューをリファクタリングするにはどうすればよいですか？

反応ネイティブには、アプリが使用されていないとき、またはバックグラウンドモードで実行されている関数ライフサイクルがありますか？

index.htmlからインポートされたJavascriptスクリプトからグローバル変数と関数にアクセスし、それらをコンポーネントで使用するにはどうすればよいですか？

エイリアスとしてバンドルされているGoogleスプレッドシートの数式を使用できますか？

PowerShellを使用してファイルをインポートし、既存のすべてのプレースホルダー変数をスクリプトで定義された変数に置き換えるにはどうすればよいですか？

このスクリプト化されたJenkinsパイプラインを適切にリファクタリングして、共通のコードを1つのファイルに保存するにはどうすればよいですか？

using句内のネストされたtry / catchブロックをリファクタリングする方法に関するアドバイス

アプリスクリプトで「不明」の基準に基づいてフィルタリングすることにより、Googleドライブからファイルを取得するにはどうすればよいですか？

グローバル変数+2つの関数で使用されている変数を削除しますか？

ジェイルブレイクされたiPhoneのSpringBoardまたは他のアプリケーションからアクセスできるグローバル環境変数を作成するにはどうすればよいですか？

ASP.NET MVCバンドルを使用しているときに、クライアントがサーバーにアクセスしてファイルが変更されているかどうかを確認するのはなぜですか？

Mac OS Xのアプリケーションバイナリファイルにドラッグアンドドロップされたファイルのリストを取得するにはどうすればよいですか？

リモートコマンドを使用して、データベースサーバーに保存されているSQLスクリプトファイルを実行することはできますか？

アプリがユーザーによってアクティブに使用されているときに、バックグラウンドスレッドのレイアウトの更新/変更に関する通知を受け取ります

関数型プログラミングスタイルでこのscalaメソッドをリファクタリングするための助けが必要

関数型プログラミングスタイルでこのscalaメソッドをリファクタリングするための助けが必要

再帰的な2dtreeのリファクタリングに関するアドバイスにはメソッドが含まれています

グリフィコンのバグに関するアドバイス？

リバースエンジニアリングされたアプリを使用しているときに、元のSHA1キーを使用して新しいリリースのAPKファイルを作成できますか？

カスタム確認ダイアログを使用して、アップロードされた複数のファイルを dropzone で削除できるようにするにはどうすればよいですか?

ビューのボタンからカスタム メソッドを呼び出して、オブジェクトに関連付けられたファイルを削除するにはどうすればよいですか? Railsアプリ

Bashスクリプトでsedを使用して、ログファイルの「var」変数に含まれる文字列パターンを削除したい

クエリを使用してCSVファイルの値をデータベースにバインドするにはどうすればよいですか？

ReactJS-リファクタリング後に別のファイルから値をロードする関数を取得できません

macOS用のCocoaアプリケーションで、NSFileWrapperを使用してバンドルをディスクに保存します。ファインダーにバンドルの正しいアイコンを表示させるにはどうすればよいですか？

ビューのボタンからカスタムメソッドを呼び出して、オブジェクトに関連付けられたファイルを削除するにはどうすればよいですか? Railsアプリ