OpenAI推出SimpleQA新基准：治理大模型“信口开河”有招了？-网界

OpenAI于近日推出了一项名为SimpleQA的新基准，旨在评估语言模型在回答简短事实寻求问题时的准确性。这一举措是AI领域追求更高事实正确性的重要一步。

据悉，SimpleQA通过一系列严格的标准来确保评估的公正性和有效性。其中包括高正确性，即参考答案需经两名独立AI训练师验证；多样性，涵盖从科学技术到娱乐等多个主题；以及前沿挑战性，相比早期的基准，SimpleQA更能测试出前沿模型的实力。

SimpleQA还注重高效用户体验，问题与答案设计得简洁明了，便于快速操作和评分。通过OpenAI API等工具，用户可以轻松地进行模型评估。

OpenAI表示，尽管SimpleQA在短查询的受限设置中测量事实准确性，但其希望这一基准的开源能够推动AI研究在更广泛领域的应用和发展。同时，SimpleQA也揭示了当前语言模型在生成事实正确回答方面仍面临的挑战，即如何减少错误输出和未经证实的答案，这一问题也被称为“幻觉”。

通过SimpleQA的推出，OpenAI期望能够进一步促进语言模型的优化和完善，使其在更多场景中发挥出更大的价值。

近日，抖音客服推出“智能代办”服务，秉承“系统多跑路、用户少操作”的宗旨，将银行卡解绑、视频审核加急等高频服务场景的办理时间从数小时压缩至40秒内，显著提升客服服务效率。针对这些痛点，抖音“智能代办”服务通…

2025-12-11

任正非对当前火热的AI算力建设提出了反常识的判断，这也是他此次发言中最引人注目的观点之一。他坦然承认：“美国只是制裁华为，中国大多数公司没有被制裁，还是可以用美国的技术、工具、生态、仪器仪表、芯片、流片的…

2025-12-11

报告核心前提是AGI兼具变革性益处与严重风险，明确了四大风险领域：误用（用户故意利用AGI造成伤害）、错位（AGI明知违背开发者意图仍造成伤害）、失误（AGI无意识导致伤害）及结构性风险（多主体互动引发的非…

2025-12-11

ShufflEval的工作原理可以这样理解：假设你有一段鲸鱼母子之间的对话录音，AI翻译器将其翻译成了几个英语句子，描述了它们关于潜水时间的讨论。即使在这种极端情况下，ShufflEval方法仍然能够有效区…

2025-12-11

用阮良的话说，“AI驱动下，需要将价值链条上的东西组合成解决方案，让AI在企业内部更好落地。”网易数智的产品，多是这样，从自家业务“长出来”的实战派——对外输出给行业前，已经历千锤百炼。阮良提到，丁磊对…

2025-12-11

天眼查工商信息显示，近日，呼和浩特火山引擎科技有限公司成立，法定代表人为王宁，注册资本100万人民币，经营范围含互联网数据服务、信息系统集成服务、数据处理服务、数据处理和存储支持服务、信息技术咨询服务、计算机…

2025-12-11

目前，3000亿参数昆仑大模型已发布43个创新应用，涵盖了智能客服、装备工程设计、财务共享等众多场景：对内提供专业应用和员工助手，在油气生产、炼化生产、运营管理、经营决策、综合办公等方面开展AI场景建设；对…

2025-12-11

2025-12-11

2025-12-11