arXiv (ML)AI
TITLE_JA: 言語モデルが帰属グラフに注釈を付与できることを実証
LLMs Can Annotate Attribution Graphs
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
言語モデルの内部動作を理解するための重要な技術であるサーキットトレーシングは、個々の特徴やMLPニューロンをスーパーノードにグループ化する手作業のステップが非常に時間がかかるという課題を抱えていました。本研究は、この煩雑なプロセスを自動化するシンプルなパイプラインを提案しています。特徴の説明を言語モデルに直接提示することで、それらを自動的にスーパーノードにグループ化するというアプローチです。
研究チームは自動化された解釈可能性メトリクスを用いて検証を行い、提案パイプラインで生成されたスーパーノードが人間のアノテータによって生成されたものと同等の解釈可能性を持つことを確認しました。二段階の首都名当てタスクでは、100回のプロンプト中97回において、中間ステップに対応するスーパーノードを正確に復元することに成功しています。これは提案手法の高い精度を示す重要な成果です。
さらに研究では、オープンエンドな探索を目的とした概念実証も提示されています。ウィキペディアのプロンプト補完から自動的に1000の帰属グラフに注釈を付与し、その後LLM判定者を用いて人間による詳細な検討に値する興味深いグラフをフラグ立てするというプロセスです。
本研究は、シンプルな自動化でも帰属グラフの注釈付与において意味のある成果を生み出せることを実証しており、さらに高度な自動サーキットトレーシングへの研究開発を促進する可能性を示唆しています。