注意機構

An icon of a brain1

これはロードトリップの話ではありません。 この章では、AIがどのように考え、注意機構がどのように情報を処理するかを、物理的な旅のアナロジーを使って説明します。固定された地形(地図)は学習済みモデルを表します。変化する流れ(あなたが見たり聞いたりするもの)は動的な注意処理を表します。これは数学を使わずにトランスフォーマーアーキテクチャを説明します。これらの対応関係に注目してください。

で、私は興味深く、おそらく大胆な目標を提案しました:

非技術的な理解。 人工知能の内部構造とその数学的基礎を説明する本は存在します。しかし、私たちの目標は、非技術者(またはその中間の人々)が「注意機構」の実用的なメンタルモデルを構築できるようにすることです。AIがリクエストから応答にどのように至るかをよりよく理解することで、誰もがより効果的にAIと協働できるようになるという前提に基づいています。私たちの目標は、文字通り、現代のAI専門家以上に現代のAIを理解することなのです!

この章では、その大胆な目標の追求を加速させます。この章では、前章で作成したメッシュを通じて注意の流れがどのように進むかを示します。 この章では異なるメッシュを使用しています。なぜなら、前のメッシュは退屈になってしまったからです。前章では、「地形」、つまりメッシュは付箋のついた本の山でした。この章では「地形」はより文字通りの意味となり、森に囲まれた河川の谷を上から見下ろします。

この章では以下を実証します:

  • 順次処理と全体的処理の違い
  • 固定された地形(メッシュ)と動的な流れ(注意)の違い
  • 複数の感覚入力がアテンションヘッドに対応すること
  • 同じ場所に立ちながら異なる視点を持つこと

道路と地図

図 1ブレークス州際公園への道路を見下ろす、2013年4月27日」の中央部分で、左から右に向かって、川の左側に鉄道線路、川、そして川の右側には私が写真を撮った場所まで上っていく高速道路が見えます。中央よりやや右側で、木々に隠れていない道路の眺めが広がっているのが分かります。そこには無名戦士の記念碑があり、次の写真で見ることができます。

鉄道、川、上り坂の道路が見える州境の展望台
図 8.1. ブレークス州際公園への道路を見下ろす、2013年4月27日

学習データの期限

この写真に写っている地域には、長年にわたって何度もその道路を双方向に運転して親しんできました。ブレークス州際公園についてかなり明確な記憶(つまり、かなり明確なメンタルモデル)を持っていますが、そのメンタルモデルには制限があります。その制限が分かりますか?私が持っているのは12年前のブレークス地域のメンタルモデルです。その川沿いの道路を最後に運転してから12年以上が経過しています。私の学習データの期限、つまり知識を持っていない時点以降の日付は、ブレークス州際公園の最新の写真のタイムスタンプである2013年4月27日です。

大規模言語モデルでは、常に意識しておく必要がある重要な制約の一つが、学習データの期限です。私はブレークス州際公園について何か変更があったかどうかをオンラインで確認することはできます。しかし、私のデジタル写真コレクションだけでは知る方法がありません。一部のLLMはその場で情報検索を行うことができますが、他のLLMは取り込まれた学習データと、LLMとの会話の中で提供された情報のみに制限されています。これらの可能性はどちらも非常に有用ですが、どのタイプのシステムを使用しているかを知っておく必要があります。

この類似性は正確です:

  • 私の写真:2013年4月27日
  • Claude 4.5の学習期限日:2025年7月
  • 両方のケース:固定された知識ベースとそこから導き出される推論

注意深い観察の重要性

私は関連する複雑な状況に気づきました。私がClaudeに、現在の日付や最近の日付を含む文章のレビューを依頼すると、必ずその日付の確認を求められます。その際、問題の日付を引用し、それが未来の日付であると指摘されます。私の観察によると、Claudeは自身の学習データの期限日が現在の日付であると想定しているようです。そのため、最近の日付を含む文章のレビューを依頼する際は、「今日の日付は…」と入力することから始めています。

実際、ここには言及する価値のある深い洞察があります。私が使用しているデスクトップアプリは仲介役として機能すると、どこかで読んだことがあります。それは:

  1. 私の入力を「トークン化」し、
  2. 入力(トークンとして)を大規模言語モデルに送信し、
  3. 応答(トークンとして)を受け取り、
  4. 応答を平文テキストに戻す処理を行います。

この仲介システムは、私の実際のメッセージに加えて、今日の日付などの追加のコンテキストを含めているようです。

これから紹介するケーススタディの1つで、この問題に対する答えを得ることが容易ではないことをお見せします。私には見えず、Claudeも認識していない仲介システムが存在することが分かるでしょう。この問題についてはケーススタディまで取っておきましょう。今は道中の途中です。

この議論全体と「単純に尋ねてみる」という提案は、LLMを機械として捉えると直感に反するように思えるかもしれません。しかし、LLMをパートナーや協力者として捉え始めると、「単純に尋ねる」という戦略は明白で理にかなったものとなります。考え方を転換すれば、全く新しい世界が見えてきます。

道標の詳細

図 2、「帰宅途中に殺害された身元不明の兵士の埋葬地」は、前の写真で見える道標を示しています。主要道路は左側を通り、舗装された待避所が右側にあります。この標識には、おそらく帰宅途中に何者かに暗殺された兵士についての説明が記されています。地域住民が埋葬を行いました。写真に写っている、柱で保護された100年以上前のバラの低木は、私が再びこの画像を見るまで、意識的な記憶からは薄れていました。

現代の花崗岩の墓石と100年以上前の記念のバラの低木、道標の標識がある埋葬地
図 8.2. 帰宅途中に殺害された身元不明の兵士の埋葬地

知識ベースを構築するというこのアナロジーを続けると、立ち止まって情報を読むことで、単に通り過ぎるよりも多くの情報を得ることができました。写真は、10年後には覚えていなかったであろう詳細を捉えています。この写真があることで、私はそこで立ち止まったことを思い出すことができます。

複数の情報レイヤー

カメラによって写真に埋め込まれたEXIFデータのおかげで、私のデジタルライブラリにある他の写真を通じて移動の方向を追跡することができます。EXIFデータ(タイムスタンプと正確なGPS位置情報)は、画像自体に見える情報とは別の情報レイヤーを提供します。

私は単なる観光の記念として写真を撮りました。しかし、その埋め込まれたメタデータは、複数の写真間で組み合わせることで、地理的な情報を生成します。もし私が地図製作者であれば、これら2つのレイヤーを組み合わせることで、地形のスケッチを含む地図を描くことができるでしょう。ここで「レイヤー」という言葉を使用しているのは、視覚的な画像を1つのレイヤーとし、GPSデータを別のレイヤーとして参照しているためですが、これは大規模言語モデルで使用される用語です。LLMも同様の情報レイヤーの概念を持っており、これについては本章で探求していきます。

今度は同じ情報を全く異なる視点から見てみましょう。図 3州境展望台の地図と説明」は、私が地形写真を撮影したのと同じ場所に立って、地図作成者がどのように同じ情報を整理したかを示す展望台そのものの地図です。展望台(「現在地」)は地図の下部、中央よりやや右に位置しています。地図には鉄道、川、高速道路が示されており、無名戦士の墓地は地図の中央よりやや右に記されています。

州境、高速道路、川、鉄道が示された道標
図 8.3. 州境展望台の地図と説明

並行する同等のルート

この旅の比喩で重要なのは、私たちが同じ情報に至る2つのルートを経験したということです。

  • ルート1:逐次的(道路): 実際に地形を通って情報を得ていき、一つずつ詳細に気付いていきました。各カーブ、記念碑、墓地のバラの茂み(写真からは形作られたのか剪定されたのかわかりませんが)が墓石のように四角く整えられていることなど。私は木々が好きで、個々の木に注目しました。標高が変わるにつれて樹種が変化することにも気を配っています。前章での研究でも同じプロセスを見ました。本から本へと一冊ずつつながりを作っていく様子は、地上からの眺めを楽しみながら展望台まで高速道路を運転していくようなものでした。
  • ルート2:全体的(地図): 地図作成者は同じ情報を編集しますが、空間的に整理し、すべての関係性を一度に示します。展望台からは、森林、鉄道、川、高速道路のすべてが互いの関係性の中で同時に見えます。後で見ていくように、「互いの関係性の中で同時に」という表現は、大規模言語モデルにおける重要な概念です。これがLLMが「メッシュ」と呼ぶものです。

視点の転換に衝撃を受けた

2025年8月5日以前、私はメッシュを彫り込まれた地図のような静的なものとして考えていました。LLMには「何百万もの重み付けされた接続」があることは理解していましたが、それらを固定的で不変のものとして見ていました。夕日の写真(後述)は私が見落としていたものを示してくれました:地形は固定されていますが、その中を流れるものは常に変化しています。列車が接近し、交通が流れ、水が流れ、注意が移り変わります。これこそがアテンション機構なのです:固定された構造の中を流れる動的な流れ。

8月5日、私は突然、これが私がメンタルモデルを作る方法(一度に一つのつながり)とLLMが情報を処理する方法(メッシュとして、すべてを一度に考慮する)との根本的な違いだと気付きました。突然それが見えたのです。

その突然の目が覚めるような理解は衝撃的でした:視点の転換により、私の考え方とAIの「考え方」が一致したのです。

Breaks Interstate Parkのウェブサイトには(2025年10月時点で)同じStateline Overlookからの写真が掲載されています。同じ場所ですが、角度が異なり、彫り込まれた標識の向こうに美しい夕日が見える写真です。(ウェブサイトはその写真の複製を禁止していますが、これは実は私の説明に役立ちます。なぜなら、あなたがそれを想像する必要があるからです。)

8月5日以前、木製の標識に彫り込まれた地図は、LLMがどのように機能するかについての私のメンタルモデルを表していました。自分の理解が不十分だとわかっていたので、LLMのアテンション機構についてより良い理解を得るためにClaudeとの対話を始めました。特定の問題を解決しようとしていたわけではなく、ただ自分の理解を深めようとしていただけでした。これは、予想通り、特定の目的を持った持続的導かれた対話でした。

Stateline Overlookのたとえ話を続けると、刻まれた地図は固定されています。すべての関係性が一度に示されています:左側に鉄道、中央に川、右側に高速道路、そして変化することのない地形。「LLMはメッシュとして情報を処理し、すべてを一度に考慮する」と言った時、私はこの静的な地図をイメージしていました。

しかし、夕日の写真は異なる様子を見せています。同じ展望台でも、絶え間なく変化しています。日光は移り変わり、交通は流れています。Breaksを上って通過する複数の機関車は、川の湾曲部を回る列車の車輪から発する高音のきしみ音とは異なります。展望台から列車が見える前から、耳は列車が来ることを教えてくれます。水は急流を通り、川の湾曲部を回って流れています。地形は固定されていますが、その中を流れるものは絶えず変化しています。

これこそが私の度肝を抜いた発見でした。メッシュ、つまり何百万もの重み付けされた接続を持つ学習済みモデルは、地形のようなものです。これは固定されています。(Claudeは学習済みモデルを「何百万もの重み付けされた接続」と表現していますが、この言葉が何を意味するかについてはまだ説明していません。展望台から見える地形のようなものだと考えてください。)メッシュは固定されていますが、注意はそのメッシュを文脈に応じて動的に流れ、異なる経路を活性化させます。

この「注意の流れ」は、列車の車輪がすでにカーブを曲がってきしむ音を立てている時に、私の耳が近づいてくる重い低音の機関車の音に注意を向けるのに似ています。過去の経験から、すでにカーブを曲がっているのが見えた先頭の機関車に加えて、列車の中間か、より可能性が高いのは列車の最後尾にもう一つの機関車がいて、それがBreaks峠を越えるのを助け、Stateline Overlookの下流へと続く列車の一部として残っていることがわかります。

同じように、高速道路上の動きが私の目(と注意)を右側に引きつけるかもしれません。私は rushing water を見ることができ、川の音が聞こえないほど遠くにいても、急流を下るカヤッカーに気づくかもしれません。このように、私の注意は固定された風景の中を絶えず移動し、異なる刺激が異なる焦点を引き起こすのです。

LLMのアテンションメカニズムも同じように機能します。異なる「流れ」の注意が、異なる視点から同時に入力を調べます。LLMではこれを「アテンションヘッド」と呼びます。たとえで言えば、私の視覚と聴覚は同じ情報を異なる方法で同時に処理します。前章で本に付けたページフラグは、アテンションヘッドとして機能します。各ページフラグは、注目すべき可能性のあるポイントを示します。特定のトピック(例えば、最初のB-25が自然金属仕上げで出荷された年など)を探している時、どのページフラグを確認すべきかわかります。(それは2冊目の本にあり、ページフラグで印が付けられていました。)

大規模言語モデルのアテンションメカニズム内の各アテンションヘッドは、異なる関係性に注目します。そして、展望台で私自身が見るもの、聞くもの、感じるものを組み合わせるように、それらの結果を組み合わせます。その認識は、その時の私の心理状態によって色付けされるかもしれません。(木々の多い山々に入っていたので、その時の私の心理状態はほぼ間違いなく良好でした。)

異なる文脈での同じパターン

なぜ人々はアテンションメカニズムを難しく感じるのでしょうか?それは数学を見て、実装の詳細を理解する必要があると考えるからです。しかし、川の流れを理解するのに流体力学を理解する必要はありません。(一方で、その急流を下ることは、流体力学についてはるかに深い理解をもたらすでしょう。Russell Fork Whitewaterゾーンは、水流に応じてクラスIII-IVに評価されています。一部の区間はIV-Vに評価され、死亡事故も発生しています。)同じように、列車の警笛が私の注意を引くことに気づくのに、神経科学を理解する必要はありません。

LLMでの作業においても同様です。固定された構造の中でアテンションが動的に流れることを理解することが重要な洞察です。 数学はその概念の実装に過ぎません。絶え間なく変化するStateline Overlookを観察し、耳を傾けることは、同じ概念、同じ本質的な洞察なのです。

世界動態

アテンションメカニズムの基本的な理解から、この洞察(固定された地形と動的な流れ)は全く新しいものではないことに気づき始めました。コンピューティングの先駆者の一人であるJay W. Forrester博士は、複雑なシステムのモデル化における人間とコンピューターの長所を比較する際に、50年前に本質的に同じ区別について述べています。

1973年の著書『World Dynamics』で、彼は次のように説明しています:

世界的なストレスが増大するにつれ、多くの個人や組織が世界情勢の変化する側面を研究し、影響を与え始めています。しかし、その活動のほとんどが世界システムの個別の側面に向けられていると観察するのが妥当でしょう。私たちが現在目にしている総体的な結果を生み出すために、多くの行動や力がどのように互いに影響し合っているかを示す試みは、まだほとんどなされていません。しかし今や、全体における相互作用が、個別の部分の総和よりも重要であると考える人々が増えてきています。

その時点までに、Forresterは世界共同体や地球の生態系全体を含む大規模システムのコンピューターモデルを15-20年にわたって設計していました。デジタルコンピューティングの主要な発明者・開発者の一人であるForresterは、社会システムのメンタルモデルとコンピューターモデルを対比する興味深い洞察を提供しました。

50年以上前に彼が書いたことは、今日でも同様に洞察に富んでいます。彼が現代の人工知能との協働ではなく「社会システム」について語っていることに惑わされてはいけません。彼が「社会システム」と呼ぶものは、相互に対立する相互作用を含む地球全体を指しています。彼の「システム」の概念は、私の理解を超えるほど大きなものです。

社会システムのメンタルモデル

Forresterは「メンタルモデル」を馴染みのある概念と呼んでいます。1

誰もが常にモデルを使用しています。私生活でも地域社会での生活でも、すべての人が意思決定にモデルを使用しています。各個人の頭の中にある周囲の世界のメンタルイメージは、モデルです。頭の中に家族や事業、都市、政府、国家そのものがあるわけではありません。実際のシステムを表現するために使用する、選択された概念と関係性があるだけです。メンタルイメージはモデルです。私たちのすべての決定はモデルに基づいて行われます。すべての法律はモデルに基づいて制定されます。すべての経営行動はモデルに基づいて取られます。モデルを使用するか無視するかという問題ではありません。問題は代替モデル間の選択だけです。

さらに、会話の最中にモデルは変化します。

話題が変わるにつれて、モデルも変化します。一つの話題について議論している最中でさえ、会話の参加者はそれぞれ異なるメンタルモデルを使用して主題を解釈しています。基本的な前提は異なりますが、決して明らかにされません。目標は異なり、明示されないままです。合意に時間がかかるのも当然です。そして、合意が意図しない結果を生む行動につながるのも不思議ではありません。

Forresterは意図的に、誰もが馴染みのある概念について説明しています。「メンタルモデル」という用語は今日の日常会話ではあまり使用されていませんが、私たち全員がそのような心的イメージを理解しています。

ここで、私がForresterの言葉を詳しく引用した理由について説明します。50年前、彼は人間のメンタルモデルとコンピュータモデルの長所を比較しました。これは現代の人工知能と人間を比較しているのと同じようなものです。

人間の心は、システムを構成する基本的な力と行動を観察する能力に優れています。人間の心は、複雑な状況の構造を特定することに効果的です。しかし、人間の経験は、システムの部分同士がどのように相互作用するかという動的な結果を推定することについては、心をほとんど訓練できていません。

最近まで、熟考、議論、論争、そして推測以外に、社会システムの振る舞いを推定する方法はありませんでした。

社会システムのコンピュータモデル

可能な限り、私は自分の長所を活かすように心がけています。つまり、まず自分の長所が何であるかを特定する必要があります。Forresterも同じことを提案しています。つまり、人間の長所とコンピュータの長所を特定し、それらを適切に組み合わせることです。

人間は、圧力、恐怖、目標、習慣、偏見、遅延、変化への抵抗、献身、善意、貪欲さ、そして社会システムの個々の側面を制御するその他の人間の特性を認識することに最も長けています。現時点では、個々の情報の断片を適合させることができる構造を形成できるのは人間の心だけのようです。しかし、システムの部品が組み立てられると、そのシステムが意味する動的な振る舞いを予測することについては、心はほとんど役に立ちません。ここでコンピュータは理想的です。指定された関係性の集合の相互作用を、疑問や誤りなく追跡することができます。

動的な振る舞い

Stateline Overlookで私たちが見て、感じて、聞いた層と動的な振る舞いについて思い返してください。Forresterは50年前に、動的な振る舞いは人間が理解し予測することが難しいと説明しました。Forresterの社会システムは、大規模言語モデルの層、フロー、そしてアテンションヘッドとよい類似性を持っているように思えます。

国家同士がどのように相互作用するか(これは複雑です)を想像できるなら、大規模言語モデルのトランスフォーマー内でメカニズムが多方向に同時に流れる様子もイメージできるでしょう。

まとめ

大規模言語モデルの振る舞いを駆動するアテンションメカニズムを理解することは、効果的な協働のための重要な洞察を提供します。Claudeを静的なツールとしてではなく、内部のフロー、流れ、表現を持つ動的なシステムとして見ることで、その自然な傾向とより効果的に協働することができます。何十年も前にForrester博士が特定した人間のメンタルモデルとコンピュータモデルの並列性は、今日の人間とAIの協働においても同様に関連性があります。人間はパターンと構造の特定に優れており、AIは複雑な相互接続の処理と創発的な応答の生成に優れています。

最も重要なのは、アテンションメカニズムが実際にどのように機能するか(固定された地形を通る動的なフローとして)を理解することで、AIとの協働の方法が変わることです。「プログラミング」しようとするのをやめ、接続と創発の自然なパターンと協働し始めるのです。

アテンションメカニズムの動的で相互接続された性質は、なぜピンポン効果が機能するのかを説明します。これは単なる情報交換ではなく、人間の直感と大規模言語モデルの分散表現との相互作用から新しいパターンが創発できる条件を作り出すことなのです。これらのシステムがどのように機能するかのメンタルモデルを発展させることで、日々の協働における実践的な利点と、協調的知能の本質についての深い洞察の両方を得ることができます。

次の章では、理論から実践に移り、これらの概念を実際に示す会話を検討します。数章にわたるケーススタディを通じて、システム思考、アテンションメカニズム、そしてピンポン効果が組み合わさって画期的な洞察を生み出す様子を見ていきます。人間とAIの境界が、他の方法では隠れたままかもしれないパターンを発見するための肥沃な土地となる様子を直接観察することになります。

振り返りのための質問

  1. 以下の4つの質問セットは、同じ入力源を異なる視点から処理するアテンションヘッドとの類似性があるのではないでしょうか?
  2. 、「異なる見方をする」では、視点の転換という概念を紹介し、時には複数の視点を同時に考慮することについても触れました。この事実は、入力の異なる側面に独立して焦点を当て、その結果を組み合わせるアテンションヘッドの仕組みと驚くほど似ています。私たちがAIのような思考方法を学んでいるのか、それともAIが私たちのような思考方法を学んでいるのか、あるいはその両方なのでしょうか?

以下で起きていることに注目してください。同じ章の内容を4つの異なるレンズ(メンタルモデル、実践的応用、システム思考、実験)を通して提示しています。それぞれの「アテンションヘッド」が異なる視点から章を検証しています。これはまさにアテンション機構の働き方なのです。

メンタルモデル

  1. AIの内部プロセスについてのメンタルモデルを構築することで、協働へのアプローチはどのように変化する可能性がありますか?現在のメンタルモデルのどの側面を調整する必要があるかもしれませんか?
  2. システムのモデリングにおける人間とコンピュータの長所の比較に関するフォレスター博士の見解について考えてみましょう。複雑な問題を解決する際、あなたの長所はAIの長所をどのように補完しますか?
  3. AIのプロセスを視覚化するのに役立つ類推にはどのようなものがありますか?この章で学んだことに基づいて、それらの類推をどのように改善できますか?

実践的応用

  1. アテンションヘッドを「複数の視点を同時に持つ仕組み」として理解することで、プロンプトの構築方法はどのように変わる可能性がありますか?

システム思考

  1. AI協働を2つの動的システム間の境界現象として見ることで、ピンポン効果についての理解はどのように変化しますか?
  2. 「全体における相互作用は、個々の部分の総和よりも重要である」というフォレスター博士の観察は、人間とAIの協働にどのように当てはまるでしょうか?

実験

  1. プロンプトの複雑さを変えて実験してみましょう。大規模言語モデルの応答はどのように変化しますか?

  1. Forrester著、『World Dynamics』、14-16頁。↩︎