网界
网络资讯 网界财经 科技人物 数据洞察 行业动态 智能出行 智能手机 数码极客 商业资讯

AI大考!七大模型挑战马斯克特斯拉入职数学题,谁能脱颖而出?

2025-04-27来源:ITBEAR编辑:瑞雪

近期,一道由特斯拉CEO马斯克在社交平台发布的数学题引发了广泛关注。这道看似简单的算式题“6÷2 (1+2)”却引发了网友们的热烈讨论,答案更是出现了“1”和“9”两种截然不同的声音。

为了解答这一疑惑,斯坦福大学的数学教授塔沃克早在8年前就通过视频进行了详细解释。他强调,按照现代的运算规则,即遵循从左至右的顺序,先进行括号内的运算,再执行乘除运算,最后得到的结果是9。然而,他也提到,在1917年的数学运算规则中,规定碰到除法时,应将左边整个算式除以右边整个算式,因此答案为1。

面对这一充满争议的数学题,人们不禁好奇,如果交给AI大模型来解答,它们能否给出正确答案,并识别出其中的争议点呢?为了验证这一点,多家知名厂商的最新AI大模型被用来进行对比测试。

在测试中,科大讯飞的讯飞星火X1大模型表现尤为突出。它不仅准确识别了图片中的数学题,还详细展示了推理过程。讯飞星火X1先按照现代运算规则得出了正确答案9,同时也考虑了将2 (1+2)视为一个整体的情况,并通过引用数学上的PEMDAS/BODMAS规则,解释了为何这种情况下需要额外的括号,再次确认了正确答案为9。讯飞星火X1还提到了网络上的争议,并指出需要明确题目的书写方式以避免歧义。

同样表现出色的还有OpenAI的o3模型。虽然它没有给出详细的推理过程,但在输出结果中,o3详细展示了计算步骤,并准确给出了答案9。对于争议点,o3的解释同样严谨,明确指出在没有括号的情况下自行施加额外的运算次序并不符合普遍的约定,并科普了旧式计算工具中隐式乘法的优先级情况。

其他模型如DeepSeek R1、字节豆包1.5、文心X1 Turbo、腾讯混元T1以及Grok 3等也进行了测试。这些模型在解答过程中大多能够按照现代运算规则得出正确答案,但在处理争议点时,有的模型解释较为含糊,有的则相对清晰。例如,豆包1.5在推理过程中简洁明了地指出了将2 (1+2)看作整体时应写作6÷[2 (1+2)],但在输出结果中反而没有详细解释这一点。

通过这次测试,我们可以看到AI大模型在深度推理能力方面已经有了显著提升。它们不仅能够按照规则准确计算,还能够识别并解释争议点,展现出类似人类的思考过程。随着技术的不断发展,AI将在未来为我们解决更多复杂问题,带来更加便捷的生活和工作体验。

马斯克xAI被曝融资150亿美元
据CNBC从知情人士处获悉,埃隆·马斯克掌舵的人工智能企业xAI于最新一轮融资中斩获约150亿美元资金,公司估值随之攀升至约2000亿美元。这一融资规模不仅远超市场此前预期,更成为近期科技领域备受瞩目的资本动作。

2025-11-14

李彦宏2025百度世界大会发声:AI内化驱动产业革新,成果加速出海
当前,百度搜索已成为全球AI化改造最激进的搜索引擎,用AI重构搜索结果页,转型成以富媒体为主的AI应用。大会上,李彦宏再次强调AI应用创新的价值。 “过去一年,我们看到模型能力逐步走出聊天机器人的范畴,数字…

2025-11-14

李彦宏:跨越临界点,AI“效果涌现”时代,内化能力引爆生产力革命
“当下非常重要的问题是,企业如何内化AI能力”——李彦宏介绍,这有三个代表性的应用方向: 李彦宏指出,百度是全球所有搜索引擎中AI化改造最激进的,用AI重构搜索结果页,而非简单插入AI摘要,“把搜索从一个以…

2025-11-14

李彦宏2025百度世界大会:AI内化驱动产业变革 开启智能生产力新纪元
“当下非常重要的问题是,企业如何内化AI能力”——李彦宏介绍,这有三个代表性的应用方向: 李彦宏指出,百度是全球所有搜索引擎中AI化改造最激进的,用AI重构搜索结果页,而非简单插入AI摘要,“把搜索从一个以…

2025-11-13

百度2025世界大会发布文心5.0大模型 参数量达2.4万亿 持续推升智能新高度
文心5.0基础能力全面升级,在多模态理解、指令遵循、创意写作、事实性、智能体规划与工具应用等方面表现突出,拥有强大的理解、逻辑、记忆和说服力。不同于业界多数的多模态模型采用后期融合的方式,文心5.0的技术路…

2025-11-13

相芯科技携AI数字人成果亮相乌镇峰会,展现浙江科技新实力
该平台深度融合人工智能与建模、驱动、交互等核心技术,实现了数字人从生产到应用的全流程效率革新。作为浙江人工智能产业发展的先行力量,相芯科技未来将继续深化AI与数字人的融合创新,推动更高效、智能的数字人应用场景…

2025-11-13