首页 > 汽车测评 > 汽车测评 > 谷歌推出两大数学模型,19秒解开IMO2024几何问题

谷歌推出两大数学模型,19秒解开IMO2024几何问题

发布时间:2024-07-26 22:54:23来源: 15210273549

六道题每题可得7分,总分最高42分。谷歌DeepMind的人工智能系统在今年国际数学奥林匹克竞赛中最终得分28分。今年金牌的门槛是29分,在正式比赛的609名选手中,58名达到了这一门槛。

DeepMind人工智能系统在IMO 2024上相对于人类竞争者的表现。在42分的总分中,人工智能系统获得了28分。

谷歌DeepMind的AI模型解决了今年国际数学奥林匹克竞赛(IMO)六个问题中的四个问题,人工智能首次达到了银牌标准。

当地时间7月25日,谷歌DeepMind公布专用于数学推理的模型AlphaProof,以及专注于几何的模型更新版本AlphaGeometry 2。DeepMind表示,AlphaProof和AlphaGeometry 2解决了数学中的高级推理问题,具有先进数学推理能力的通用人工智能或开启科学和技术的新领域。

IMO是历史最悠久、规模最大、最负盛名的青年数学家竞赛,自1959年以来每年举办一次。选手要解决代数、组合学、几何和数论方面六个异常困难的问题。菲尔兹奖是数学家的最高荣誉之一,菲尔兹奖获得者也会代表他们的国家参加IMO。

近年来,IMO竞赛被认为是机器学习领域的重大挑战,也是衡量人工智能系统高级数学推理能力的理想基准。

谷歌DeepMind表示,IMO的数学问题被人工翻译成数学语言,供系统理解。在正式比赛中,学生们分两次提交答案,每次4.5小时。而人工智能系统在几分钟内解决了一个问题,花了三天时间来解决其他问题。基于强化学习的推理系统AlphaProof解决了两个代数问题和一个数论问题并被证明答案正确,这些问题包括今年IMO比赛中只有5名选手解决的最难的问题。AlphaGeometry 2证明了几何问题,但两个组合问题仍未解决。

六道题每题可得7分,总分最高可达42分。DeepMind的人工智能系统最终得分28分。DeepMind表示,今年金牌的门槛从29分开始,在正式比赛的609名选手中,有58名达到了这个门槛。

“事实上,这个程序能想出这样一个不明显的结构是非常令人印象深刻的,远远超出了我认为的最先进的水平。”IMO金牌得主和菲尔兹奖牌得主蒂莫西·高尔斯(Timothy Gowers)表示。

在大量书面文本上训练的人工智能模型历来在数学推理方面很困难,往往倾向于语言智能而非数学智能,解决数学问题需要更复杂的推理技能。AlphaProof将预先训练好的语言模型与AlphaZero强化学习算法结合在一起,AlphaZero此前自学了如何掌握国际象棋、将棋和围棋。

大语言模型容易产生幻觉,或以令人信服的方式传递错误信息。DeepMind表示,尽管基于自然语言的方法可以访问更多数据,但会产生看似合理但不正确的中间推理步骤和解决方案。而形式语言提供了一个重要优势,即涉及数学推理的证明可以被形式化地验证其正确性。“我们通过微调Gemini模型,在这两个互补的领域之间建立了一座桥梁,自动将自然语言问题语句转换为形式语句,创建了一个不同难度的庞大形式问题库。”

当遇到一个数学问题时,AlphaProof会生成候选解决方案,然后搜索可能的证明步骤来证明或反驳它们。每一个被发现和验证的证明都被用来强化AlphaProof的语言模型,增强其解决后续更具挑战性问题的能力。

汽车测评更多>>

配零重力座椅,华为乾崑智驾,续航1400km,这台新能源车值得一看 座椅2+2+2布局,配冰箱,优惠后18.86万起,家用看这款中大型SUV 座椅2+2+2布局,车长超5米,配冰箱,东风奕派eπ008带劲不? 座椅2+2+3座椅,2.5L油混+四驱,惠后32.78万,这款中大型MPV香? 配L2级辅助驾驶,爆243马力,惠后16.39万,家用可以看这款中型车 前排双零重力座椅,3.9秒破百+魔毯悬架,家用看这款豪华中型SUV 座椅2+2+2布局,252马力+9AT,降幅3万,家用看这款合资中大型SUV 朋友8.5万买卡罗拉,总觉得哪里不对,你们说呢? 五菱惊世K-Car!侧滑门神车仅6万?国产车王再战江湖? 中法汽车新秀会师巴黎:零跑B10与雪铁龙C5 Aircross的同场竞技 新车外观调整/两种动力/最高续航415公里,新款雪铁龙-C4发布 比亚迪打响“清仓价格战”!从20多万降到10万,车长近5米 零百加速4.3秒,六七座可选,比亚迪唐dmp现在还能买吗? 丰田终于妥协了!从17万降至11万,油耗5L使用92号汽油 中年用户成消费主力,吉利该到“去年轻化”的时候了 奥迪5米巨兽PK保时捷!百万豪车市场暗战,谁主沉浮? 苹果iOS18.1 Beta7初体验:信号、续航与流畅度全面评测 2024年巴黎车展:零跑B10跨界车登陆欧洲市场 小鹏P7+巴黎车展开启预售,订单突破3万台 新势力最快!理想第100万辆车下线,雷军、李斌都来庆祝... 广汽集团“开荒”欧洲,冯兴亚:一点又一点,小鸟筑成巢 特斯拉Optimus机器人被曝在发布会受远程操控,有场外员工监督帮助其与来宾互动 用高德也能打无人驾驶的士了,就在广州!价格低过出租车 深圳楼市延续“十一”行情,332套房3个半小时“日光” 天猫3C数码火爆开局:42个品牌双11预售首小时成交同比翻倍 淘宝天猫宠物双11预售金额90分钟超去年首日 苹果出货量创历史同期新高 消费电子景气度延续可期 苹果:新果上市价格或稳中偏弱 6400-7000元/吨 vivo X200系列发布,4299元起售,一篇文章看完这三款产品 vivo X200系列正式发布:全球首发公里级无网通信