https://suprmind.ai/hub/ai-hallucinatio ... enchmarks/
不管是AI 吹还是AI 空,都应该长期关注这项研究。
以下由chat gpt 简化,请自行查正。
幻觉率↓:模型遇到不知道/无法回答的问题时,仍然给出错误答案的比例,越低越好。
注意:准确率和幻觉率不是简单的“100%-关系”。
有些模型倾向于猜答案,因此准确率可能不错,但幻觉率也很高;
有些模型更愿意说“不知道”,幻觉率就会低很多。
不同 benchmark 的数字也不能直接混在一起比较。
原始报告:
https://suprmind.ai/hub/ai-hallucinatio ... enchmarks/