
AI Research2026-07-22
IEEE Spectrum AI
AI理解力新指標「精靈係數」問世
一個研究團隊提出了名為「精靈係數」(Genie coefficient)的新指標,旨在衡量AI系統理解使用者意圖的能力。與現有專注於原始性能的基準測試——例如數學題目的準確率或語言流暢度——不同,「精靈係數」的目標是捕捉用戶明確要求AI做的事,與他們內心未說出的假設之間的差距。
這個名稱是向經典的「精靈」故事橋段致敬——精靈實現願望的方式,往往出乎意料,甚至引發麻煩。同樣地,AI模型經常誤解使用者的請求,因為它們缺乏人類視為理所當然的上下文、細微差別或常識。例如,要求AI「訂一張去巴黎的機票」,結果可能買到一張飛往美國德州巴黎(Paris, Texas)的機票,而不是法國巴黎,除非使用者特別說明。
「精靈係數」的運作方式是,讓AI模型執行一些刻意包含模糊地帶或隱含限制的任務。接著,這項指標會評估模型是否能正確識別並解決這些模糊之處——可能是透過提出釐清問題,或是根據上下文推斷出最可能的意圖。精靈係數高,代表AI擅長解讀言外之意;分數低,則表示它太照字面意思解讀指令。
現有的基準測試如MMLU、HumanEval和GSM8K,雖然擅長衡量知識與推理能力,但未能捕捉AI互動中這個關鍵面向。隨著AI系統越來越融入日常生活——驅動客服機器人、個人助理和自主代理——理解意圖的能力,變得與原始智慧同等重要。
研究團隊希望「精靈係數」能推動業界打造更直覺、更友善的AI系統。如果獲得廣泛採用,它可能成為模型評估的標準環節,就像圖靈測試曾經是機器智慧的基準一樣。目前這項指標仍處於實驗階段,但初步結果顯示,它可能揭露即使是最高階模型也存在的驚人弱點。