小红书大模型IMO满分夺金,第三题解法让冠军选手直呼优雅
哈?小红书你真是闷声干大事啊!
刚刚,
IMO 2026
小红书
经IMO官方评定,
小红书大模型dots-note-3.0
满分
震惊了,这还是我印象中的小红书吗?首次登上世界级竞赛,就来了场开门红~
再往下深扒,小红书大模型dots-note-3.0的解题方式也让人眼前一亮又一亮:它
仅用自然语言
非常规解法
图片由AI生成
双CMO金牌得主
刘涵祚
模型最终给出了一条正确且漂亮的证明思路。这种解法结构紧凑、逻辑自然,即使放在IMO解答中,也属于较为简洁优雅的一类。
CMO金牌得主
汪千桐
从数学审美的角度看,小红书大模型dots-note-3.0的解答非常漂亮也很优雅。常规解法已经很巧妙,但dots直接攻克了题目最难、也最本质的部分。
在他看来,dots解题
简洁明了而且直击本质
为什么当前的大模型需要IMO
先来个科普,讲讲IMO究竟是什么,又为何各家都在争先送自家大模型上考场。
IMO又叫
国际数学奥林匹克竞赛
这对大模型来说,难度极高,却也是最直观的能力展示途径。以
Gemini
这背后是一次跨代的能力跃迁。往深了说,数学就是大模型智力与推理能力的试金石,大模型在IMO这类数学竞赛中走得越远,越能说明其底层优势。
再举个最近的例子,就在本周,
Fable 5
除此之外,IMO还有一个相比Benchmark得天独厚的优势——
未知
一位头部模型研究员对此给出了这样的判断:
在今天的模型训练里,你基本可以认为,互联网上一旦出现了某些数据,很快就会被模型拿去训练,模型也就知道了。所以如果要测试一个模型到底聪不聪明,
。只能测一些没有公开过的东西
这恰是同步参与官方IMO测评之于大模型最难复制的价值。
它考验的不是模型记住了多少题目和数学知识,而是在一个真正未知的问题第一次出现时,模型能否独立理解、探索,并最终完成严密推理。
而且只有新题还不够,官方评测采用的是严格的当届赛事流程。每个比赛日的学生考试结束后,模型团队才会收到当天题目,并须在规定期限内提交PDF答卷。模型将直接阅读英文题目并生成证明,工作人员只负责保障系统运行。最终答卷则由来自不同国家的IMO评审员,按照正式标准进行审阅。
本届新题、规定时间、完整证明、第三方专业评审
一分没丢,比拿到金牌更难
正因如此,这次小红书大模型dots-note-3.0能拿到金牌,还是满分,就显得格外醒目。
六道题全部做对,首先证明的是
Agentic推理系统稳定性
其次,小红书大模型dots-note-3.0直接一步到位,使用自然语言端到端处理,也意味着模型能够像人类选手一样直接读懂题目、自主寻找路径,具备从问题理解到答案表达的完整闭环。它代表模型拥有
可迁移的通用推理能力
具体来说,在本次答题过程中,小红书大模型dots-note-3.0用
智能体
图片由AI生成
不过,让人真正感到惊喜的,还是第三题传递出的
模型创新思维
归纳
抓住了问题最本质的结构
这也解释了,为什么CMO得主汪千桐会用漂亮和优雅来形容这套答案。小红书大模型dots-note-3.0对问题结构的剖析之深,会让人自然而然产生一种恍然大悟的感觉。
回到结果本身上,模型能够在本届拿下满分,其实相当不易,我们可以从以下几个层面来看。
第一层,本届整套赛题的得分难度明显高于去年。
第二层,满分与金牌之间亦有差距,今年整整相差13分。
小红书大模型dots-note-3.0即将开源
选择
IMO
Coding
数学
所以对小红书而言,这是
一次重要的技术亮相
过去,外界对小红书的技术认知,更多集中在内容社区、推荐算法和内容理解上。在
基础模型
IMO满分不一样,42分就摆在那里,足以证明,
小红书已经具备值得行业认真审视的基础模型能力
新玩家
P.S.对应模型即将开源~敬请期待