今日も窓辺でプログラム

外資系企業勤めのエンジニアが勉強した内容をまとめておくブログ

Scala

Scala + SparkでDatasetを使ってTFIDFを計算する

はじめに 前回の記事ではSparkをローカルで試せる環境を用意しました。 Windows Subsystem for Linux(WSL)でSpark環境を構築してみる - 今日も窓辺でプログラム 今回は日本語のテキストファイルに含まれる単語数をカウントする処理をSpark上で行ってみたいと…