谷歌发布FACTS Grounding基准,衡量人工智能模型的真实性

作者:Yu 来源:原创 2024-12-19

  12月19日消息,谷歌DeepMind推出了FACTS Grounding,这是一个新的基准测试,旨在测试大型语言模型(LLM)生成事实准确、基于文档的响应的能力。

  该基准测试在Kaggle上进行,旨在解决人工智能领域最紧迫的挑战之一:确保人工智能输出以提供给它们的数据为基础,而不是依赖外部知识或引入幻觉——看似合理但不正确的信息。

  目前的FACTS Grounding排行榜根据真实性得分对大型语言模型进行排名,谷歌的gemini-2.0-flash-exp领先83.6%,紧随其后的是gemini-1.5-flash-002,占82.9%,gemini-1.5-pro-002占80.0%。

  Anthropic的claude-3.5连接-20241022以79.4%排名第四,而OpenAI的gpt-4o达到78.8%,排名第五。排名较低的是Anthropic的claude-3.5-haiku-20241022得分74.2%,其次是gpt-4o-mini得分71.0%。

  OpenAI的较小型号o1 mini和o1预览版分别以62.0%和61.7%的得票率位居排行榜。

  FACTS Grounding的独特之处在于,它需要合成详细输入文档的长篇回复,使其成为迄今为止人工智能真实性最严格的基准之一。

  FACTS接地代表了人工智能行业的一个关键发展,特别是在信任和准确性至关重要的应用中。通过评估医学、法律、金融、零售和技术等领域的LLM,该基准为提高现实世界场景中的AI可靠性奠定了基础。

发布
X
第三方账号登录
  • 微博认证登录
  • QQ账号登录
  • 微信账号登录

企业俱乐部