网界
网络资讯 网界财经 科技人物 数据洞察 行业动态 智能出行 智能手机 数码极客 商业资讯

AI新考验!ARC-AGI-2测试来袭,AI模型成绩惨淡远不及人类

2025-03-25来源:ITBEAR编辑:瑞雪

近期,由知名人工智能专家弗朗索瓦·肖莱携手创立的非营利组织Arc Prize基金会,在其官方博客上揭晓了一项名为ARC-AGI-2的全新测试。该测试旨在深入评估当前领先的人工智能模型的通用智能水平,其难度系数极高,令众多AI模型望尘莫及。

根据Arc Prize排行榜的数据揭示,那些在推理领域表现突出的AI模型,例如OpenAI的o1-pro和DeepSeek的R1,在ARC-AGI-2测试中的得分仅仅徘徊在1%至1.3%之间。即便是GPT-4.5、Claude 3.7 Sonnet和Gemini 2.0 Flash等强大的非推理型模型,其得分也仅维持在1%左右的低水平。

ARC-AGI测试由一系列复杂谜题构成,要求AI从一组色彩斑斓的方块中辨识出隐藏的视觉规律,并据此生成正确的“答案网格”。这些问题设计精巧,旨在考验AI面对全新问题的应变能力。为了设定人类基线,Arc Prize基金会邀请了超过400名参与者参与ARC-AGI-2测试。结果显示,这些参与者组成的“团队”平均正确解答了测试中60%的问题,这一成绩远超所有AI模型的表现。

肖莱在X平台上强调,相较于先前的ARC-AGI-1测试,ARC-AGI-2更能精准反映AI模型的实际智能水平。Arc Prize基金会的测试旨在评估AI系统能否在脱离训练数据的情况下高效习得新技能。

肖莱指出,与ARC-AGI-1相比,新的测试版本有效防止了AI模型依赖“蛮力”——即庞大的计算能力——来寻找答案。他承认,这是ARC-AGI-1的一个主要弊端。为了弥补这一不足,ARC-AGI-2引入了“效率”这一新指标,并要求模型实时解读模式,而非依赖记忆。

Arc Prize基金会联合创始人格雷格·卡姆拉德在其博客文章中写道:“智能不仅仅在于解决问题或获取高分的能力,这些能力的获取效率和部署方式同样至关重要。我们提出的核心问题不仅限于‘AI能否习得完成任务所需的技能?’,还包括‘以何种效率和成本?’”

ARC-AGI-1在五年内无人能敌,直到2024年12月,OpenAI发布了其先进的推理模型o3,该模型超越了所有其他AI模型,并在评估中达到了人类水平的表现。然而,当时便指出,o3在ARC-AGI-1上的卓越表现是以高昂的成本为代价的。在ARC-AGI-2测试中,即便使用价值200美元的计算资源,OpenAI的o3模型(低配版)的得分也仅为4%。

ARC-AGI-2的推出恰逢其时,科技行业正迫切呼吁建立新的、尚未饱和的基准来评估AI的进展。Hugging Face联合创始人托马斯·沃尔夫在最近接受采访时指出,AI行业缺乏足够的测试来衡量通用人工智能的关键特质,如创造力。

Arc Prize基金会还宣布了2025年Arc Prize竞赛,向开发者发起挑战,要求在ARC-AGI-2测试中达到85%的准确率,同时每项任务的成本不超过0.42美元(约合3元人民币)。

阿里巴巴“通义”App升级更名“千问”,AI战略转向消费级市场新布局
根据官方消息,“千问”定位为阿里旗下最重要的大模型应用入口,其核心能力基于阿里自研的大模型体系Qwen(千问)。 分析人士指出,阿里此前在To B市场和模型研发侧拥有技术基础,但在消费端应用分发层面还未形成…

2025-11-15

Dexmal原力灵机获近10亿融资 阿里蔚来资本助力具身智能研发落地
IT之家 11 月 14 日消息,具身智能公司 Dexmal 原力灵机今日宣布完成数亿元 A+ 轮融资,阿里巴巴为独家投资方。IT之家注意到,该公司 A 轮融资由蔚来资本领投,洪泰基金、联想创投、锡创投和正…

2025-11-14

百度世界大会发布文心大模型5.0 参数量2.4万亿能力达全球领先
文心5.0基础能力全面升级,在多模态理解、指令遵循、创意写作、事实性、智能体规划与工具应用等方面表现突出,拥有强大的理解、逻辑、记忆和说服力。不同于业界多数的多模态模型采用后期融合的方式,文心5.0的技术路…

2025-11-13