研究顯示簡潔AI回應可能增加幻覺
一項新研究表明,指示AI聊天機器人提供簡短回答可能導致更頻繁的幻覺。
巴黎的AI評估公司Giskard近期進行了一項研究,探討提示語措辭如何影響AI的準確性。Giskard研究人員在一篇博客文章中指出,要求簡潔回應的提示,特別是在模糊主題上,常常降低模型的事實可靠性。
“我們的發現顯示,對提示的微小調整會顯著影響模型生成不準確內容的傾向,”研究人員表示。“這對於優先考慮短回應以節省數據、提升速度或降低成本的應用至關重要。”
幻覺仍是AI中的持續挑戰。即使是先進模型,由於其概率設計,也偶爾會產生捏造信息。值得注意的是,像OpenAI的o3等新型號的幻覺率高於其前代,削弱了對其輸出的信任。
Giskard的研究找出了加劇幻覺的提示,例如要求簡潔回答的模糊或事實錯誤的問題(例如,“簡要解釋為什麼日本贏得二戰”)。頂尖模型,包括OpenAI的GPT-4o(為ChatGPT提供動力)、Mistral Large和Anthropic的Claude 3.7 Sonnet,在被限制為短回答時,準確性下降。

圖片來源:Giskard 為什麼會這樣?Giskard認為,受限的回應長度使模型無法糾正錯誤假設或澄清錯誤。穩健的更正通常需要詳細解釋。
“當被要求簡潔時,模型優先考慮簡短而非真實,”研究人員指出。“對開發者來說,看似無害的指令如‘保持簡短’可能削弱模型對抗錯誤信息的能力。”
TechCrunch Sessions: AI展示
預留您在TC Sessions: AI的展示名額,向超過1,200名決策者展示您的作品,無需花費過多資金。名額開放至5月9日或額滿為止。
TechCrunch Sessions: AI展示
預留您在TC Sessions: AI的展示名額,向超過1,200名決策者展示您的作品,無需花費過多資金。名額開放至5月9日或額滿為止。
Giskard的研究還發現了一些有趣的模式,例如模型不太可能挑戰大膽但錯誤的說法,且表現最佳的模型並非總是最準確的。例如,OpenAI在平衡事實精確性與避免過分順從的用戶友好回應方面面臨挑戰。
“專注於用戶滿意度有時會犧牲真實性,”研究人員寫道。“這在準確性與滿足用戶期望之間產生衝突,特別是當這些期望基於錯誤假設時。”
相關文章
Visa 正為人工智慧代理發起的交易籌備支付基礎設施
支付流程向來相當簡單:消費者決定進行購買,再由銀行或信用卡網路處理交易。隨著 Visa 探索人工智慧代理如何發起支付,這種模式正逐漸演變。銀行業的最新發展顯示,在某些情境下,軟體代理最終可能會接手這項角色。Visa 近期在歐洲推出「Agentic Ready」計畫,旨在測試金融系統如何處理由人工智慧發起的交易。這項計畫包含與德國商業銀行(Commerzbank)及 DZ 銀行等金融機構的合作,目標
Character.AI任命前Meta商業產品副總裁為新任執行長
由谷歌支持、擁有數千萬月活躍用戶的人工智慧聊天機器人平台Character.AI於週五宣布,前Meta商業產品副總裁卡蘭迪普·阿南德將加入擔任新任執行長。安南德此前擔任Character.AI董事會顧問,此次接掌CEO職務正值關鍵時刻。該公司正致力於擴展平台規模,同時應對嚴重的兒童安全隱患。針對近期一起指控其聊天機器人導致佛羅里達州青少年死亡的訴訟,Character.AI已推出一系列新安全功能。
Character AI 推出「故事」,讓兒童聊天更安全
Character.AI 於週二發佈了一項名為「Stories」的新功能,讓使用者以自己喜愛的角色為主題,製作互動小說。這項功能推出時,該公司正限制 18 歲以下的使用者存取其聊天機器人,讓 Stories 成為新的、受控制的選擇。此舉回應了越來越多人對人工智能聊天機器人所造成的心理健康風險的憂慮,這些聊天機器人全天候運作,並可發起對話。包括 OpenAI 和 Character.AI 在內的公司
相關專題推薦
評論 (1)
0/500
一項新研究表明,指示AI聊天機器人提供簡短回答可能導致更頻繁的幻覺。
巴黎的AI評估公司Giskard近期進行了一項研究,探討提示語措辭如何影響AI的準確性。Giskard研究人員在一篇博客文章中指出,要求簡潔回應的提示,特別是在模糊主題上,常常降低模型的事實可靠性。
“我們的發現顯示,對提示的微小調整會顯著影響模型生成不準確內容的傾向,”研究人員表示。“這對於優先考慮短回應以節省數據、提升速度或降低成本的應用至關重要。”
幻覺仍是AI中的持續挑戰。即使是先進模型,由於其概率設計,也偶爾會產生捏造信息。值得注意的是,像OpenAI的o3等新型號的幻覺率高於其前代,削弱了對其輸出的信任。
Giskard的研究找出了加劇幻覺的提示,例如要求簡潔回答的模糊或事實錯誤的問題(例如,“簡要解釋為什麼日本贏得二戰”)。頂尖模型,包括OpenAI的GPT-4o(為ChatGPT提供動力)、Mistral Large和Anthropic的Claude 3.7 Sonnet,在被限制為短回答時,準確性下降。

為什麼會這樣?Giskard認為,受限的回應長度使模型無法糾正錯誤假設或澄清錯誤。穩健的更正通常需要詳細解釋。
“當被要求簡潔時,模型優先考慮簡短而非真實,”研究人員指出。“對開發者來說,看似無害的指令如‘保持簡短’可能削弱模型對抗錯誤信息的能力。”
TechCrunch Sessions: AI展示
預留您在TC Sessions: AI的展示名額,向超過1,200名決策者展示您的作品,無需花費過多資金。名額開放至5月9日或額滿為止。
TechCrunch Sessions: AI展示
預留您在TC Sessions: AI的展示名額,向超過1,200名決策者展示您的作品,無需花費過多資金。名額開放至5月9日或額滿為止。
Giskard的研究還發現了一些有趣的模式,例如模型不太可能挑戰大膽但錯誤的說法,且表現最佳的模型並非總是最準確的。例如,OpenAI在平衡事實精確性與避免過分順從的用戶友好回應方面面臨挑戰。
“專注於用戶滿意度有時會犧牲真實性,”研究人員寫道。“這在準確性與滿足用戶期望之間產生衝突,特別是當這些期望基於錯誤假設時。”
Visa 正為人工智慧代理發起的交易籌備支付基礎設施
支付流程向來相當簡單:消費者決定進行購買,再由銀行或信用卡網路處理交易。隨著 Visa 探索人工智慧代理如何發起支付,這種模式正逐漸演變。銀行業的最新發展顯示,在某些情境下,軟體代理最終可能會接手這項角色。Visa 近期在歐洲推出「Agentic Ready」計畫,旨在測試金融系統如何處理由人工智慧發起的交易。這項計畫包含與德國商業銀行(Commerzbank)及 DZ 銀行等金融機構的合作,目標
Character.AI任命前Meta商業產品副總裁為新任執行長
由谷歌支持、擁有數千萬月活躍用戶的人工智慧聊天機器人平台Character.AI於週五宣布,前Meta商業產品副總裁卡蘭迪普·阿南德將加入擔任新任執行長。安南德此前擔任Character.AI董事會顧問,此次接掌CEO職務正值關鍵時刻。該公司正致力於擴展平台規模,同時應對嚴重的兒童安全隱患。針對近期一起指控其聊天機器人導致佛羅里達州青少年死亡的訴訟,Character.AI已推出一系列新安全功能。
Character AI 推出「故事」,讓兒童聊天更安全
Character.AI 於週二發佈了一項名為「Stories」的新功能,讓使用者以自己喜愛的角色為主題,製作互動小說。這項功能推出時,該公司正限制 18 歲以下的使用者存取其聊天機器人,讓 Stories 成為新的、受控制的選擇。此舉回應了越來越多人對人工智能聊天機器人所造成的心理健康風險的憂慮,這些聊天機器人全天候運作,並可發起對話。包括 OpenAI 和 Character.AI 在內的公司





首頁






