数値と言語の境界──計算問題でLLMが間違える構造的要因
この記事の要点 LLMは言語パターンの学習に最適化されており、数値計算は本質的に苦手 トークン化の仕組みが大きな数値の演算を困難にしている 外部ツール連携(Code Interpreter等)が現実的な解決策だが万能ではない 言語モデルに数学を問う矛盾 「23957 × 4812は?」──この質問に対してGPT-4は時に正しい答えを返し、時に誤る。2024年のLMSYS Chatbot Arenaのデータによれば、4桁以上の整数の乗算におけるLLMの正答率は約60%にとどまる。これは、LLMが本質的に「言語パターン」を学習するシステムであり、計算機ではないことに起因する。 問題の核心はトークン化にある。多くのLLMのトークナイザーは数値を1〜3桁のチャンクに分割する。たとえば「23957」は「239」「57」や「23」「957」のように分割され、数値としての一体性が失われる。これにより、桁の繰り上がりを含む演算は、モデルにとって「パターンの一般化」が困難なタスクとなる(Nogueira et al., 2021, “Investigating the Limitations of Transformers with Simple Arithmetic Tasks”, EMNLP 2021)。 解決策とその限界 OpenAIのCode Interpreter(現Advanced Data…