メインコンテンツへスキップ
見出し画像

AI(Transformer)自身が奨めるTransformer理解のために読んだ方が良い論文6選

    ベスト6

    1. Attention Is All You Need(Vaswani et al., 2017) arXiv:1706.03762 — 3/3(全員一致) Transformerそのものを提案した原論文。RNNを排し、Self-Attentionだけで系列処理を行うという設計思想を確立した、全ての分析研究の出発点。

    2. Transformer Feed-Forward Layers Are Key-Value Memories(Geva et al., 2020) arXiv:2012.14913 — 2/3(Gemini・Claude) Transformer内のFFN層を「キー・バリュー記憶」として解釈した論文。第1層がパターン検出(キー)、第2層が対応する予測分布の出力(バリュー)として働き、層全体が知識を蓄える連想記憶になっていることを示した。これまで深掘りしてきたGeva研究の起点となる一本。

    3. Scaling Laws for Neural Language Models(Kaplan et al., 2020) arXiv:2001.08361 — 2/3(Gemini・Grok) モデルサイズ・データ量・計算量に対して性能がべき乗則に従うことを実証した論文。個々の機構ではなく、Transformerの「マクロな振る舞い」を規定した現代LLM開発の設計図的存在。

    4. Locating and Editing Factual Associations in GPT(ROME)(Meng et al., 2022) arXiv:2202.05262 — 2/3(Gemini・Claude) Causal Tracingという因果的介入手法で、特定の事実知識がどの層のどのニューロンに宿っているかを特定し、実際にピンポイントでモデルの知識を書き換えられることを示した。Gevaの「FFN=記憶」説を実践的に裏付ける論文。

    5. Are Sixteen Heads Really Better than One?(Michel et al., 2019) arXiv:1905.10650 — 2/3(Gemini・Claude) 訓練済みTransformerから多くのAttentionヘッドを推論時に刈り込んでも性能がほとんど落ちないことを示し、「マルチヘッド」の必要性そのものに疑問を投げかけた実証研究。

    6. What Does BERT Look At? An Analysis of BERT's Attention(Clark et al., 2019) arXiv:1906.04341 — 2/3(Gemini・Claude) BERTの膨大なAttentionヘッドを分析し、特定のヘッドが代名詞の指示先や構文関係(主語・動詞など)を明示的な教師なしで捉えていることを可視化とともに報告した古典的名著。


     
     
    AI関連の一般的な記事と技術的な記事が中心になっています、今。

    あなたへのおすすめ