GPT-4とClaude、同じプロンプトで何が変わるのか
この記事の要点 同一プロンプトでもGPT-4とClaude 3では回答の構造・論調・情報源が異なる 差異の主因は学習データ、RLHF方針、システムプロンプトの設計哲学にある ユーザーは「正解が一つ」と仮定せず、複数モデルのクロスチェックが有効 比較実験の概要 2026年第1四半期、筆者らは100の日本語プロンプトをGPT-4(OpenAI)とClaude 3 Opus(Anthropic)に同時入力し、出力の構造的差異を分析した。プロンプトは「事実確認型」(30問)、「意見要求型」(30問)、「創作型」(20問)、「技術解説型」(20問)の4カテゴリに分類した。 結果として最も顕著な差異が見られたのは「意見要求型」であった。GPT-4は一般的に複数の立場を並列して提示し、最終的な判断をユーザーに委ねる傾向が強かった。一方、Claude 3はより明確な分析的立場を示しつつ、前提条件や不確実性を詳細に述べる傾向があった。 構造的な差異の要因 OpenAIのRLHF(人間のフィードバックによる強化学習)の方針は「有用性・無害性・正直性」のバランスを重視しているとされ、Anthropicの「Constitutional AI」アプローチは安全性の原則を明示的に組み込んでいる(Bai et al., 2022, “Constitutional AI”, Anthropic Research)。これらの設計哲学の違いが、出力の論調に影響していると考えられる。 ただし、Gao et al.(2024, “Cross-Model Consistency in LLMs”, ACL 2024)の研究では、事実確認型のプロンプトにおいてGPT-4とClaude…