
AI Research2026-07-22
IEEE Spectrum AI
AIの意図理解度を測る「ジーニー係数」登場
研究者チームが、AIシステムがユーザーの意図をどの程度理解しているかを測定するための新しい指標「ジーニー係数」を提案しました。既存のベンチマークが数学問題の正解率や言語の流暢さといった生のパフォーマンスに焦点を当てているのに対し、ジーニー係数はユーザーがAIに明示的に依頼した内容と、その実行方法に関する暗黙の前提との間のギャップを捉えることを目的としています。
この名称は、願いを予想外の、しばしば問題のある方法で叶えてしまうという古典的なジーニー(魔神)の比喩に由来しています。同様に、AIモデルは人間にとって当然の文脈、ニュアンス、常識を欠いているため、ユーザーのリクエストを誤って解釈することがよくあります。例えば、AIに「パリ行きのフライトを予約して」と依頼した場合、ユーザーが特に指定しなければ、フランスのパリではなく、テキサス州パリへの航空券が予約されてしまう可能性があります。
ジーニー係数は、意図的な曖昧さや暗黙の制約を含むタスクをAIモデルに提示することで機能します。そして、そのモデルが曖昧さを正しく特定し、解決できたかどうかを評価します。具体的には、明確化のための質問をするか、文脈に基づいて最も可能性の高い意図を推論するかによって評価します。ジーニー係数が高い場合は、AIが行間を読む能力に優れていることを示し、低い場合は指示を文字通りに受け取りすぎていることを示します。
現在のベンチマーク(MMLU、HumanEval、GSM8Kなど)は知識と推論力を測定するのに優れていますが、AIインタラクションのこの重要な側面を捉えることはできていません。AIシステムがカスタマーサービスのボット、パーソナルアシスタント、自律エージェントとして日常生活により深く統合されるにつれて、意図を理解する能力は、単なる生の知能と同じくらい重要になります。
研究者らは、ジーニー係数が業界をより直感的でユーザーフレンドリーなAIシステムの構築へと押し進めることを期待しています。広く採用されれば、チューリングテストがかつて機械知能のベンチマークとして機能したように、モデル評価の標準的な一部となる可能性があります。現時点では、この指標はまだ実験段階ですが、初期の結果は、最も先進的なモデルでさえ驚くべき弱点を明らかにする可能性を示唆しています。