
トピックモデル
トピックモデル
トピックモデルとは、大量のテキストを分析することで、主題を抽出するための手法のこと。
1つのデータを複数のクラスターへ割り当てることができます。主に3つの手法が有名です。
潜在的意味解析(LSA)
確率的潜在的意味解析(PLSA)
潜在的ディレクトリ配分法(LDA)
潜在的意味解析(LSA)
トピックを抽出するためのベーシックな手法。
確率的潜在的意味解析(PLSA)
確率の考え方を取り入れた潜在的意味解析。
ある確率に基づいて文章は生成されていて、1つの文章は一定の確率をもって複数のトピックに関連付けられていることを仮定しています。
文章が増えるにつれて、過学習しやすいです。
潜在的ディレクトリ配分法(LDA)
ディレクトリ分布という確率に基づいて各文章や単語が生成されるという仮定をしながら、トピックの確率値を出力します。
確率的潜在的意味解析よりも汎化性能が向上しています。
最後に
貴重な時間を使い本ノートを読んでいただきありがとうございます。
Xやってますので、ためになると思われたらフォローやリポストお願いします。
https://x.com/silverDdoger?t=U7aB3ZQyofCXaImq8TzZMA&s=09
また、ノートに対しての感想いただけると励みになりますのでよろしくお願いします。
G検定爆速勉強法も是非参考にしてください。