単語頻度分析
解析した単語を小文字化し出現回数の多い順に集計します。
使い方
- 文章を入力して実行します。
主な機能と処理範囲
同一lowercase tokenをMapにまとめ、worker経路でも同じrunTextロジックを使います。
処理の仕組み
Unicode対応word tokenを小文字化してcountし回数降順にsortします。
例
Cat cat dogはcat:2、dog:1です。
こんな場面で便利
- 反復語と語彙分布を素早く見るとき
利用前の確認
- stemming・同義語統合・形態素解析はせず活用形は別tokenです。
よくある質問
Catとcatは合算?
はい。小文字化後に同じkeyです。