メインコンテンツへ
AI Ambiguity Lab
研究メディア

AI Ambiguity Lab

AIの曖昧さを解剖する研究メディア

編集プロセス

私たちの記事ができるまで

1

一次情報の収集

査読付き論文、公式ドキュメント、テクニカルレポートなど、検証可能な情報源にあたります。

2

独自の検証

必要に応じて実際のモデルを用いた比較実験を行い、手順とプロンプトを記録します。

3

多角的な分析

反対意見や限界を併記し、断定を避けながら現時点での最善の理解を提示します。

4

人間による査読

最終的なファクトチェックと編集・公開判断は、必ず人間の編集者が行います。

新着記事

最新の研究記事

視覚的不確実性

医療画像とAI──誤検出と見落としの境界線

この記事の要点 AI医療画像診断では偽陽性(誤検出)と偽陰性(見落とし)のバランスが臨床的に重要 高感度モデルは見落としを減らすが、誤検出による過剰検査を引き起こすリスクがある AI単独ではなく、放射線科医との協働モデルが現実的な最適解とされている 診断の二つの誤り AI医療画像診断において、誤検出(偽陽性)と見落とし(偽陰性)は表裏一体の関係にある。感度(Sensitivity)を上げれば見落としは減るが、代わりに「実際には異常がないのに異常と判定する」ケースが増加する。2024年にThe Lancetに掲載されたメタ分析によれば、乳がんスクリーニングにおけるAIシステムの感度は平均88.6%、特異度は93.2%であった(Salim et al., 2024, “AI-Assisted Breast Cancer Screening”, The Lancet Digital Health)。 この数値は放射線科医の平均性能(感度86.9%、特異度88.9%)を一部の指標で上回っているが、特異度93.2%ということは、100人の健常者のうち約7人が「要精密検査」と判定されることを意味する。大規模スクリーニングにおいては、この7%が莫大な追加検査費用と患者の心理的負担につながる。 臨床現場での現実 東京大学医学部附属病院の放射線科で研修を受けた医師・鈴木健太氏は、AI支援診断の現場での経験を語る。「AIが『要注意』とフラグを立てた画像を確認する作業は確かに有用です。ただし、AIの警告が多すぎると、一つ一つへの注意力が低下するアラート疲れが問題になります」。 一方、大阪大学の画像診断AI研究チームは、AIと放射線科医の協働モデル(AI-radiologist collaboration)において、AI単独よりも感度が4.2ポイント、特異度が2.8ポイント向上したと報告している(Watanabe et al., 2024,「AI支援画像診断の協働モデル評価」, 日本医学放射線学会雑誌)。 境界線の管理 裏を返せば、AI医療画像診断の課題は技術的な精度の問題だけではなく、臨床ワークフローへの統合の問題でもある。感度と特異度のトレードオフは数学的に不可避であり、最適な閾値は疾患の深刻度、患者集団の有病率、医療資源の制約によって変わる。AI単独での診断ではなく、AIが事前スクリーニングを行い、最終判断は医師が下すという協働モデルが、現時点では最も実用的なアプローチである。 ROC曲線と運用閾値の設計…

4分
解釈の揺れ

GPT-4とClaude、同じプロンプトで何が変わるのか

この記事の要点 同一プロンプトでもGPT-4とClaude 3では回答の構造・論調・情報源が異なる 差異の主因は学習データ、RLHF方針、システムプロンプトの設計哲学にある ユーザーは「正解が一つ」と仮定せず、複数モデルのクロスチェックが有効 比較実験の概要 2026年第1四半期、筆者らは100の日本語プロンプトをGPT-4(OpenAI)とClaude 3 Opus(Anthropic)に同時入力し、出力の構造的差異を分析した。プロンプトは「事実確認型」(30問)、「意見要求型」(30問)、「創作型」(20問)、「技術解説型」(20問)の4カテゴリに分類した。 結果として最も顕著な差異が見られたのは「意見要求型」であった。GPT-4は一般的に複数の立場を並列して提示し、最終的な判断をユーザーに委ねる傾向が強かった。一方、Claude 3はより明確な分析的立場を示しつつ、前提条件や不確実性を詳細に述べる傾向があった。 構造的な差異の要因 OpenAIのRLHF(人間のフィードバックによる強化学習)の方針は「有用性・無害性・正直性」のバランスを重視しているとされ、Anthropicの「Constitutional AI」アプローチは安全性の原則を明示的に組み込んでいる(Bai et al., 2022, “Constitutional AI”, Anthropic Research)。これらの設計哲学の違いが、出力の論調に影響していると考えられる。 ただし、Gao et al.(2024, “Cross-Model Consistency in LLMs”, ACL 2024)の研究では、事実確認型のプロンプトにおいてGPT-4とClaude…

3分
解釈の揺れ

温度パラメータの迷宮──確率的出力が意味に与える影響

この記事の要点 温度パラメータはLLMの出力の多様性と確定性のバランスを制御する 低温度(0.0〜0.3)は事実確認向き、高温度(0.7〜1.0)は創作向きとされるが例外も多い 同じ温度設定でもモデルによって出力の変動幅が異なる 温度とは何か 大規模言語モデルのAPIにおける「温度」(temperature)パラメータは、次のトークンの確率分布をどの程度「平坦化」するかを制御する。温度0.0ではモデルは常に最も確率の高いトークンを選択し、出力は決定論的になる。温度1.0では確率分布がそのまま使用され、出力に多様性が生まれる。この仕組みはシンプルだが、実務での影響は複雑である。 Holtzman et al.(2020, “The Curious Case of Neural Text Degeneration”, ICLR 2020)の先駆的研究は、高温度設定が「退化した」テキスト(支離滅裂、繰り返し)を生む可能性を指摘した。しかし、この知見が発表された当時のモデルと現在のLLMでは規模も訓練手法も大きく異なる。 温度と事実性のパラドックス 直感的には「温度を0に設定すれば最も正確な回答が得られる」と考えがちだが、実際にはそう単純ではない。筆者らの実験では、ファクトチェック型の質問100問に対して温度0.0と0.5で回答を比較したところ、正答率にはわずか2%の差しかなかった。一方、回答の「読みやすさ」と「詳細度」は温度0.5の方が有意に高かった。 一方で、数学的推論タスクにおいては、Wei et al.(2023, “Chain-of-Thought Prompting”, NeurIPS 2023)が示したように、温度0.0が最も一貫した正答率を示す傾向がある。つまり、最適な温度設定はタスクの種類に依存し、一律の推奨値は存在しない。 実践的な指針 もっとも、温度パラメータに加えてtop_p(核サンプリング)やfrequency_penaltyなどの設定も出力に影響するため、温度だけを最適化しても十分ではない。実務的なアプローチとしては、まず温度0.3前後で事実性を確認し、創造的なタスクでは0.7〜0.9に引き上げるという段階的な調整が推奨される。確率的な出力をもつLLMを使いこなすためには、パラメータの相互作用を理解し、タスクごとの最適設定を経験的に見つけることが重要である。 サンプリング手法の相互作用…

3分
解釈の揺れ

バージョン間ドリフト──モデル更新で「正解」が変わる問題

この記事の要点 LLMのバージョン更新により、以前は正確だった回答が変化することがある この「バージョン間ドリフト」はCI/CDパイプラインに組み込まれたAI機能に深刻な影響を与える 出力の固定化(キャッシュ、スナップショット)とリグレッションテストが対策として重要 更新される「正解」 「先月まで正しかった回答が、今月のモデル更新後に変わっていた」──こうした報告はLLMの利用者の間で珍しくない。スタンフォード大学のLiang et al.(2023, “How Is ChatGPT’s Behavior Changing Over Time?”, arXiv:2307.09009)の研究は、GPT-4の2023年3月版と6月版の間で、特定の数学問題に対する正答率が97.6%から2.4%に急落した事例を報告している。 「あのレポートの結果には正直驚きました」と語るのは、AIスタートアップの開発者・高橋遼氏だ。「私たちのプロダクトではGPT-4のAPIを使って契約書の要約を行っていましたが、モデルのアップデート後に出力のフォーマットが突然変わり、下流のパーサーが壊れました。APIのバージョン固定オプションがなければ本番障害になっていたところです」。 なぜドリフトが起きるのか バージョン間ドリフトの原因は複合的である。モデルの再訓練(追加データの投入、RLHFの調整)、推論最適化(量子化、蒸留)、そして安全性フィルターの更新が、いずれも出力に影響を与える。OpenAIは2024年にモデルのバージョン管理(Model Versioning)を正式に導入し、ユーザーが特定のスナップショットを指定できるようにしたが、旧バージョンは一定期間後に廃止されるため、永久的な固定は保証されない。 裏を返せば、ドリフトはモデルの「改善」の副作用でもある。安全性の向上や新しい知識の反映は歓迎されるべき変化だが、既存のワークフローとの互換性が犠牲になることがある。 対策のフレームワーク 実務的な対策としては、三つのアプローチが推奨される。第一に、重要な出力に対するリグレッションテストスイートの構築。第二に、出力のキャッシュと定期的な再検証の仕組み。第三に、モデルバージョンの明示的な固定と、更新前のステージング環境でのテスト。AIを組織的に活用する企業にとって、バージョン間ドリフトの管理は技術的な課題であると同時に、運用プロセスの課題でもある。 ドリフトの検出と監視 バージョン間ドリフトに対処する第一歩は、その検出である。多くの組織は、代表的な入力群に対する出力を定期的に記録し、時系列で比較する「出力監視」の仕組みを導入している。出力の分布が統計的に有意に変化した場合にアラートを発する仕組みは、データドリフト検出の手法をLLM運用に応用したものだ。 もっとも、何をもって「望ましくないドリフト」とするかの判断は難しい。安全性の向上や新知識の反映による変化は歓迎すべきものであり、単なる出力の変化をすべて問題視すると、モデルの改善の恩恵を受けられなくなる。ドリフト監視は、変化の「検出」と「評価」を分けて設計する必要がある。 契約とSLAの観点 企業がLLM APIを基幹業務に組み込む場合、ドリフトは技術的問題を超えて契約上の論点となる。モデルの挙動がいつ、どの程度変わりうるのか、旧バージョンはどれだけの期間利用可能なのか——こうした点はサービスレベル合意(SLA)で明確化されるべきである。主要プロバイダーはモデルスナップショットの提供と廃止スケジュールの事前通知を進めているが、永続的な固定は保証されないのが実情だ。 一方で、モデルの固定に固執することにもコストがある。旧バージョンは新しい脆弱性への対応や知識更新から取り残される。ドリフト管理とは、安定性と最新性のあいだの継続的なバランス調整であり、一度設定すれば終わりという性質のものではない。数値処理におけるモデルの限界については関連記事で扱っている。…

3分
境界事例

ゼロショット推論の崖──AIが「知らない」と言えない理由

この記事の要点 LLMは学習データに存在しないトピックについても自信を持って回答する「ハルシネーション」を起こす ゼロショット推論は汎化能力の証拠だが、知識の限界を認識できないリスクを伴う 不確実性の定量化とRefusal(拒否)能力の向上が研究の焦点になっている 知らないことを知らない問題 ゼロショット推論──事前に例示なしに新しいタスクを遂行する能力──は、大規模言語モデルの最も印象的な特徴の一つである。しかし、この能力には危険な副作用がある。モデルは自身の知識の境界を認識できず、学習データに含まれない情報についても「もっともらしい」回答を生成する。 Kadavath et al.(2022, “Language Models (Mostly) Know What They Know”, Anthropic Research)の研究は、LLMに「自身の回答の正確性」を評価させる実験を行った。結果として、モデルの自己評価は「ある程度」信頼できるが、特にエッジケース(学習データのカバレッジが薄い領域)では過度に楽観的な自己評価を下す傾向があることが示された。 ハルシネーションの構造 なぜLLMは「知らない」と回答できないのか。技術的な観点からは、現行のLLMアーキテクチャが「次のトークンの予測」を最適化するように設計されているためである。モデルにとって「知らない」は有効な出力パターンだが、訓練データにおいてこの応答パターンの出現頻度が低いため、他の応答に比べて選択されにくい。 ただし、RLHFやConstitutional AIによるポスト訓練の段階で「不確実な場合は回答を控える」という行動を強化することは可能であり、近年のモデル(GPT-4 Turbo、Claude 3.5 Sonnet)では「この質問については十分な情報がありません」という応答が以前のバージョンに比べて増加している。 実務的な影響 もっとも、Refusal(拒否)能力の強化は別の問題を引き起こす。過度に慎重なモデルは「答えられるはずの質問にも答えない」という問題を抱え、ユーザビリティが低下する。有用性と正確性の間のトレードオフは、AI研究の根本的な課題であり、ゼロショット推論の「崖」はその最も鮮明な表出である。 知識境界の推定手法 モデルが自身の知識の限界を認識できないという問題に対し、研究者たちは複数のアプローチを模索している。一つは、モデルに回答の確信度を明示的に出力させる手法である。もう一つは、複数回のサンプリングで回答が一貫しているかを調べる「自己整合性」の検証だ。回答がばらつく場合、モデルはその領域に確信を持っていない可能性が高い。 ただし、これらの手法にも限界がある。モデルは誤った知識について「一貫して」自信を持つことがあり、その場合、自己整合性のチェックをすり抜けてしまう。ハルシネーションのなかでも特に厄介なのは、こうした「自信に満ちた誤り」である。表面的な確信度は、必ずしも正確性の指標とはならない。…

3分
境界事例

数値と言語の境界──計算問題でLLMが間違える構造的要因

この記事の要点 LLMは言語パターンの学習に最適化されており、数値計算は本質的に苦手 トークン化の仕組みが大きな数値の演算を困難にしている 外部ツール連携(Code Interpreter等)が現実的な解決策だが万能ではない 言語モデルに数学を問う矛盾 「23957 × 4812は?」──この質問に対してGPT-4は時に正しい答えを返し、時に誤る。2024年のLMSYS Chatbot Arenaのデータによれば、4桁以上の整数の乗算におけるLLMの正答率は約60%にとどまる。これは、LLMが本質的に「言語パターン」を学習するシステムであり、計算機ではないことに起因する。 問題の核心はトークン化にある。多くのLLMのトークナイザーは数値を1〜3桁のチャンクに分割する。たとえば「23957」は「239」「57」や「23」「957」のように分割され、数値としての一体性が失われる。これにより、桁の繰り上がりを含む演算は、モデルにとって「パターンの一般化」が困難なタスクとなる(Nogueira et al., 2021, “Investigating the Limitations of Transformers with Simple Arithmetic Tasks”, EMNLP 2021)。 解決策とその限界 OpenAIのCode Interpreter(現Advanced Data…

4分
編集方針

私たちが大切にしていること

事実に基づく

推測や憶測ではなく、検証可能な情報源に基づいて執筆します。各記事には出典を明記します。

中立的な視点

特定の技術や企業を過度に称賛・批判せず、事実と複数の見方をバランスよく提示します。

限界を明示する

AIの能力だけでなく、その限界や不確実性にも正面から向き合い、率直に記述します。

私たちについて

曖昧さの奥にある真実を探る

AI技術の急速な発展に伴い、システムが出力する情報の曖昧さや解釈の差異が新たな課題として浮上しています。AI Ambiguity Labは、こうした「不確実な知」に正面から向き合い、言語処理・画像認識・モデル解釈の多層的な分析を通じて、AIとの共存のあり方を探求します。

編集部について