2026 / 08 / 22
彩神vll-中美之外唯一 SKT模型A.X K2数学能力达奥赛金牌水平

【CNMO科技动静】8月11日动静,韩国SKT自立研发的AI模子A.X K2于国际数学奥林匹克竞赛(IMO)评测中取患上29分的成就,与2026年IMO金牌分数线持平,成为除了美国及中国以外地域开发的AI模子中独一到达该尺度的选手。与此同时,该模子于全世界数学推理基准测试中也创下并列最高分纪录,其数学推理能力得到多方验证。

图源网络图源收集

据SKT新闻室宣布的信息,A.X K2于IMO 2026的六道标题问题评测中得到29分,满分42分。这一分数刚好与本年IMO金牌分数线不异。值患上留意的是,中国小红书旗下的dots-note-3.0于该评测中取患上满分42分,A.X K2则是紧随其后、独一到达金牌尺度的韩国本土AI模子。

于IMO 2025往届试题评测中,A.X K2一样体现精彩,取患上35分的成就,跨越了其时的金牌分数线。于韩国数学奥林匹克(KMO)2026第二轮评测中,该模子更是斩获满分。此前,其前代模子A.X K1于KMO第一轮测验中也曾经得到韩国自研模子中的最高分。

于开源AI平台Hugging Face的MathArena AIME 2026排行榜上,A.X K2以97.1%的正确率登顶。AIME是美国数学奥林匹克的选拔测验,MathArena AIME 2026基在本年AIME试题公然了30道标题问题,用在评估AI模子的终极谜底正确率。于这一高难度数学推理评测中,A.X K2与OpenAI前首席技能官米拉·穆拉蒂创建的Thinking Machines Lab旗下的Inkling模子并列最高分。中国阶跃星斗的Step-3.5-Flash取患上96.67%,月之暗面的Kimi-K2.6得到96.4%。

图源网络图源收集

数学能力之以是被视为AI模子的焦点机能指标,缘故原由于在它可以或许查验模子将繁杂问题拆解为多个步调、举行逻辑推理并患上出一致结论的能力,而非纯真的计较速率。数学问题的另外一上风于在谜底对于错分明,便在客不雅验证模子的推理能力,这与天然语言评测中难以区别"看似合理"及"真正准确"谜底的环境形成对于比。

正因云云,高程度的数学推理能力不仅是金融、管帐等范畴的主要运用基础,同样成为权衡AI于制造工艺优化、物流调理、科学研究等需要繁杂计较及多阶段判定的财产范畴运用潜力的要害指标。计较或者推理历程中的微小偏差可能致使成本上升或者决议计划掉误,是以AI模子的切确推理能力至关主要。

版权所有,未经许可不患上转载

-彩神vll