文脈が消える瞬間──機械翻訳が「行間」を読めない理由
この記事の要点 機械翻訳は明示的な情報の変換には優れるが、暗黙の文脈を保持できない 日本語の省略構文(主語省略・ゼロ代名詞)は翻訳精度を著しく低下させる 文書レベル翻訳モデルの研究が進んでいるが、実用化には課題が残る 文レベルから文書レベルへ ニューラル機械翻訳(NMT)の登場以降、翻訳品質は飛躍的に向上した。しかし、多くのNMTシステムは依然として文単位で翻訳を行う。つまり、前後の段落や章全体の文脈は翻訳プロセスに反映されにくい。Google Researchが2023年に発表した論文では、文書レベルの文脈を考慮するトランスフォーマーモデルが文レベルモデルに比べて代名詞解決タスクで14ポイント高い精度を示した(Tiedemann & Scherrer, 2023, “Document-Level Neural Machine Translation”, ACL 2023)。 日本語から英語への翻訳では、この問題が特に深刻になる。日本語では主語の省略が一般的であり、「行きました」という一文だけでは「誰が」行ったのかを確定できない。文脈情報なしには、機械翻訳は「I went」「He went」「She went」のいずれかを推測するしかなく、この推測が頻繁に誤る。 暗黙知の壁 さらに厄介なのは、文化的な暗黙知の扱いである。「お疲れ様です」という日本語のビジネス挨拶は直訳すれば「You must be tired」だが、実際の意味はまったく異なる。Google翻訳は近年この表現を「Thank you for your hard work」と訳すようになったが、それでも場面によっては不適切な場合がある。退勤時の挨拶と、メール冒頭の定型句では、ニュアンスが異なるからだ。…