谷歌发布FACTS Grounding基准,衡量人工智能模型的真实性
12月19日消息,谷歌DeepMind推出了FACTS Grounding,这是一个新的基准测试,旨在测试大型语言模型(LLM)生成事实准确、基于文档的响应的能力。
该基准测试在Kaggle上进行,旨在解决人工智能领域最紧迫的挑战之一:确保人工智能输出以提供给它们的数据为基础,而不是依赖外部知识或引入幻觉——看似合理但不正确的信息。
目前的FACTS Grounding排行榜根据真实性得分对大型语言模型进行排名,谷歌的gemini-2.0-flash-exp领先83.6%,紧随其后的是gemini-1.5-flash-002,占82.9%,gemini-1.5-pro-002占80.0%。
Anthropic的claude-3.5连接-20241022以79.4%排名第四,而OpenAI的gpt-4o达到78.8%,排名第五。排名较低的是Anthropic的claude-3.5-haiku-20241022得分74.2%,其次是gpt-4o-mini得分71.0%。
OpenAI的较小型号o1 mini和o1预览版分别以62.0%和61.7%的得票率位居排行榜。
FACTS Grounding的独特之处在于,它需要合成详细输入文档的长篇回复,使其成为迄今为止人工智能真实性最严格的基准之一。
FACTS接地代表了人工智能行业的一个关键发展,特别是在信任和准确性至关重要的应用中。通过评估医学、法律、金融、零售和技术等领域的LLM,该基准为提高现实世界场景中的AI可靠性奠定了基础。
发布
X
第三方账号登录
-
微博认证登录
-
QQ账号登录
-
微信账号登录
企业俱乐部
Copyright (C) 1997-2026 Chinabyte.com, All Rights Reserved
