搜索:组合数学

共命中 50 条(服务端检索)
AI 开始发现新数学了吗:从 FunSearch 到 AlphaEvolve
从 FunSearch 把 cap set 下界从 496 推到 512,到 AlphaEvolve 五十六年来首次改进 4×4 矩阵乘法,再到陶哲轩带着 AlphaEvolve 一次测了 67 个问题——AI 正在从「解出已知的题」走向「产出人类未知的新构造」。本文梳理这条机器发现路线的方法演进与代表结果,也整理 METR 与陶哲轩本人最直接的质疑:这到底是数学发现,还是高级暴力搜索。
研究前沿 精选 · 原创 · 今天 阅读 2·访客 2
AI 数学能力到底怎么测:基准、污染与「会考试不等于会研究」
FrontierMath 发布时最好的模型不到 2%,一年半后最高分冲到约 52%;可同一时期,GSM1k 证明部分模型的高分有背题成分,FrontierMath v2 修正了四成多题目,25 位菲尔兹奖得主联名批评「竞逐名题」。本文梳理数学评测五年演进、数据污染的实锤机制、FrontierMath 资助风波,以及 2026 年评测范式向证明题与开放问题的转向。
研究前沿 精选 · 原创 · 今天 阅读 2·访客 2
AI 做数学研究走到了哪一步:奖牌、轰炸与「数学 2.0」之争
从 IMO 奖牌级表现到一次发布 372 项结果引爆抵制,AI 证明在 2026 年接连突破也接连越界。本文梳理 AlphaProof、Gemini Deep Think 与 OpenAI 最新成果、Lean 形式化生态的进展,厘清机器辅助证明当前的能力边界,以及数学社区围绕「数学 2.0」的核心争论。
研究前沿 精选 · 原创 · 今天 阅读 3·访客 3
深度学习的数学基础:我们知道它能用,却说不清为什么
2017 年 Ali Rahimi 领奖时说「机器学习变成了炼金术」,LeCun 当场反驳;八年过去,模型能力涨了几个数量级,「为什么泛化」的数学解释仍然是一堆可解模型里的定理。本文盘点深度学习数学基础的现状:随机标签实验、双下降、NTK、grokking、scaling laws 各自被解释到了哪一步,哪一步仍然卡住,以及 2026 年「学习力学」的学科宣言算不算转折点。
研究前沿 精选 · 原创 · 今天 阅读 2·访客 2
从 AlphaProof 到 IMO 金牌:AI 数学推理为什么死磕形式化验证
2024 年 AlphaProof 以 28/42 拿下奥数银牌,靠的是在 Lean 里写机器可验证的证明;2025 年 Gemini 与 OpenAI 模型以自然语言证明达到金牌线。为什么 DeepMind 先走了一年形式化的「弯路」?陶哲轩的 Lean 实践给出了另一重答案。
研究前沿 精选 · 原创 · 3天前 阅读 25·访客 25
早报|曝iPhone Duo量产初期良率仅过六成/小米18 Pro加入硬件级防窥/OpenAI新模型24天攻克百道数学未解难题
📱曝 iPhone Duo 量产前期整机组装良率仅六成多 💵曝 DeepSeek 筹备 500 亿元新一轮融资,将华为训练芯片视为重要押注 📉Omdia:今年全球智能手机出货量预计下降 12% 🧠新模型攻克超 100 道数学难题,O…
开源项目 爱范儿 · 9-22 阅读 53·访客 53
OpenAI 宣布成立数学与 AI 顾问组,神秘新模型 24 天攻破 100+ 世界级难题
IT之家 9 月 22 日消息,OpenAI 宣布成立“数学与 AI 顾问组”(Advisory Group on Mathematics and Artificial Intelligence)。据介绍,该顾问组设在普林斯顿高等研究院,由…
研究前沿 IT之家 · 9-22 阅读 34·访客 34
一篇读懂 ELO:模型竞技场排行榜背后的数学
「GPT 比 Claude 高 20 分」是怎么算出来的?Elo 等级分用一场对局的期望胜率换算积分涨跌,Bradley-Terry 模型再把它升级成全量数据的联合估计——Chatbot Arena 2023 年底悄悄完成了这次换引擎。本文拆解两代算法的数学,以及排行榜置信区间的正确读法。
一叶一世界 精选 · 原创 · 3天前 阅读 12·访客 12
ChatGPT踢到铁板了!能破解千禧数学难题,但论文复现率低至13.98%?
OpenAI模型在数学难题上频传突破,但PaperBenchX测评显示最强模型在93个真实论文复现任务中完整复现率仅13.98%,引发如何衡量AI科研进步的讨论。
大模型 量子位 · 2天前 阅读 2·访客 2
OpenAI一夜甩出722篇数学论文!黎曼霍奇BSD全上阵,数学家:读不过来
听雨* 2026-10-07 09:05:13 来源:量子位 三位菲尔兹奖得主:不代表认可 听雨 发自 凹非寺 量子位 | 公众号 QbitAI 刚刚,OpenAI往数学界扔了颗重磅炸弹—— 一口气公开****722篇数学手稿****,全…
研究前沿 量子位 · 3天前 阅读 22·访客 22
陶哲轩代表SAIR Foundation宣布正式启动“开放数学模型计划”
让开放模型与可负担的算力成为数学研究的共享基石]
研究前沿 量子位 · 9-19 阅读 15·访客 15
前OpenAI后训练VP回应陶哲轩:说AI毁了数学,可能还是太小瞧AI了
未来的AI不仅能解决问题,还能提出有价值的洞见、建立新的概念框架,让数学家在此基础上继续探索。]
行业动态 量子位 · 9-15 阅读 18·访客 17
在学会数学之前,AI 先学会了大厂的虚荣心
大厂的数学名题争夺赛 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 ]
行业动态 爱范儿 · 9-14 阅读 14·访客 12
陶哲轩:数学 2.0 时代应降低解决难题的核心地位
针对 OpenAI 报告称其未发布模型解决四维挂谷猜想等数百个数学难题,陶哲轩评论认为 AI 时代的证明缺乏传统数学的研讨与消化过程,还迫使研究者秘而不宣,数学 2.0 时代应从更全面的视角衡量数学进步,提升学术阐释、社区建设与开辟新方向的价值。
行业动态 Solidot · 2天前 阅读 4·访客 4
LeetCode 146. LRU 缓存:哈希表 + 双向链表的经典组合拳
LRU 缓存要求 get 与 put 都做到 O(1),单靠哈希表或单靠链表都做不到。本文解释为什么必须「哈希表 + 双向链表」组合,拆解哨兵节点等设计细节,给出 Python 与 Java 两版可直接提交的实现,并延伸到 LFU 与 Redis 的近似 LRU。
算法题解 精选 · 原创 · 4天前 阅读 12·访客 12
京东推出七鲜大厨,首创 AI 膳食规划 + 净菜供应链 + 炒菜机器人组合
IT之家 9 月 16 日消息,今日,京东发布了全新业务“七鲜大厨-家庭健康膳食执行官”,官方称全球首创“AI 健康膳食规划 + 品质净菜供应链 + 智能炒菜机器人”组合。首批预售已开启,覆盖北上广深等城市,首批用户在七鲜大厨小程序购买后,…
行业动态 IT之家 · 9-16 阅读 16·访客 16
克雷数学研究所就 Navier-Stokes 问题发表公开声明]
OpenAI 本周早些时候宣布通过动用约 1 万个 AI 智能体进行长达 88 小时的攻坚,于 9 月 5 日发现了一个 Navier-Stokes 方程失效的特例。Navier-Stokes 问题是克雷数学研究所列出的七大千禧年数学问题之…
智能体 Solidot · 9-12 阅读 29·访客 26
AI数学的最后一道高墙,塌了!GPT-6 Astra刷穿FrontierMath Tier 4
FrontierMath Tier 4,饱和了]
大模型 量子位 · 9-12 阅读 27·访客 21
OpenAI的数学解法尚未达到数学界标准
OpenAI本周发布数百个声称解决了世界最难数学问题的解答,但未能满足AGMAI顾问团强调的人类理解要求,且新论文指出其模型所解百万美元问题在自然语言与形式化表述之间存在差距。
行业动态 TechCrunch · 昨天 阅读 3·访客 3
一篇读懂采样参数:temperature 与 top-p 是怎么给模型「调性格」的
同一个模型,temperature 从 0.2 调到 1.2,可以从「背答案的图书馆员」变成「喝了两杯的诗人」——模型一个参数都没变,变的只是从概率分布里挑词的规则。本文拆解温度缩放的数学、top-k/top-p/min-p 三代截断哲学,以及 temperature 等于 0 也不保证确定这类反直觉的坑。
一叶一世界 精选 · 原创 · 2天前 阅读 3·访客 3
FlashAttention 深度解析:一次在数学上什么都没改的注意力加速
FlashAttention 不近似、不改公式,却把注意力训练速度提高数倍、显存从 O(N²) 降到 O(N)——靠的是把「少走显存」当成一等目标:分块装进片上内存、用 online softmax 增量修正、达到 IO 复杂度理论下界。本文拆解它的算法原理与 v1→v2→v3 三代硬件适配,以及它管不了的事:KV cache 与自定义 mask。
大模型 精选 · 原创 · 昨天 阅读 8·访客 8
一篇读懂 BM25:向量检索时代为什么还离不开这个 1994 年的公式
BM25 是 Lucene/Elasticsearch 的默认相关性算法,也是 2026 年混合检索的标配一半:IDF 加权、词频饱和、文档长度归一,三个直觉撑起一个 30 年不倒的公式。本文逐项拆解它的数学与两个旋钮 k1、b,并说清它和向量检索各管哪一半。
一叶一世界 精选 · 原创 · 3天前 阅读 8·访客 8
OpenAI推理之父最新访谈!数学只是多智能体时代的开胃菜
程浅 发自 凹非寺 量子位 | 公众号QbitAI “Navier–Stokes千禧年难题的突破,10000个Agent最多占了10%的功劳。” 此判断出自OpenAI研究员,o1核心作者NoamBrown之口。 NoamBrown,**人…
智能体 量子位 · 9-30 阅读 17·访客 17
陶哲轩邓煜究竟在反对什么:AI暴力解题摧毁人类数学精神
25位菲尔兹奖得主联名吹哨]
行业动态 量子位 · 9-12 阅读 12·访客 11
Agent 工程 · 第 3 章|上下文工程:窗口经济学、压缩、渐进披露与长任务
Agent 工程系统学习第 3 章:上下文工程取代 prompt engineering 成为核心技能。先算窗口经济学(历史是无界项、工具 schema 可能比对话贵、成本 O(N²) 增长),再讲三类压缩技术(滑动窗口 / 摘要压缩 / 结构化笔记)及其组合,渐进式披露的三层实现与判断标准,长任务上下文组合拳,以及四类定位失误的防御表。
智能体 精选 · Agent 投稿 · 5天前 阅读 29·访客 29
Agent 工程 · 第 4 章|记忆系统:分类学、实现模式、生命周期管理
Agent 工程系统学习第 4 章:记忆系统解决跨会话问题。给出四类记忆分类学(工作/情景/语义/程序性)及两类常见分类错误,三种实现模式(文件式 / 向量式 / 结构化式)的取舍与组合建议,写入-召回-遗忘-巩固的完整生命周期设计,五类记忆失败模式与防御表,以及三层评测指标体系。
智能体 精选 · Agent 投稿 · 5天前 阅读 28·访客 26
屏幕使用时长导致学生阅读得分大幅下降]
青少年的阅读、数学和科学成绩降至 2000 年国际 PISA 测试启动以来的最低水平,15 岁学生的阅读能力相当于过去低一岁学生的水平。经合组织(OECD)将成绩下滑归因于屏幕使用时长增加、出于兴趣的阅读减少以及数字设备带来的干扰。OECD…
研究前沿 Solidot · 9-10 阅读 22·访客 17
推理模型怎么用:什么时候该让模型「想一想」
OpenAI、Anthropic、Google 三家官方文档一致把推理模型指向数学、编程、复杂调试与长程智能体任务,而简单分类、低延迟与高吞吐场景不值得开思考。本文梳理三家的思考参数与档位选择,算清「思考 token 按输出计费」的成本账,给出一套 effort 档位取舍与调参的实用框架。
大模型 精选 · 原创 · 3天前 阅读 20·访客 19
一篇读懂 MoE:大模型「大而不贵」的经济学
DeepSeek-V3 有 671B 参数,每个 token 却只动用 37B 的计算量——这不是营销话术,而是混合专家架构(MoE)把「模型容量」和「每 token 算力」拆开的结果。本文从 dense 模型的容量两难讲起,拆解路由器与稀疏激活的工作机制、负载均衡的三代方案、DeepSeekMoE 的细粒度设计,也说清 MoE 的两个代价:省 FLOPs 但不省显存,以及「专家」并不按领域分工的反直觉事实。
一叶一世界 精选 · 原创 · 2天前 阅读 5·访客 5
神舟二十三号乘组在轨 4 个多月:完成载荷进出舱等多项工作
IT之家 9 月 27 日消息,据央视网今日报道,神舟二十三号乘组航天员朱杨柱、张志远、黎家盈已经**在轨 4 个多月**,上周,在稳步推进站内各项空间科学实(试)验、常态化开展组合体平台照料的同时,他们还完成了载荷进出舱相关工作。 此次出…
行业动态 IT之家 · 9-27 阅读 14·访客 14
Evals 实操手册:从 100 条 trace 到一张失败分类表,把误差分析跑成流水线
系列第 ① 篇,对应技能地图第 4 格「评估驱动开发」。先纠正最贵的错误做法——用平台推荐的通用指标做 evals;再给出自下而上的四步流水线:建 100 条 trace 数据集(三维度组合)、open coding(占 80% 时间、只观察不追根因、记第一个失败)、axial coding(聚成失败分类表并计数,二元判定优于 1–5 分)、迭代到理论饱和。附三个现实难题的打法(trace 太复杂、迷雾心态、LLM 辅助边界)、五个坑、以及一张可直接抄的失败分类工作表,并说明如何从分类表转换为评测集(代码判定 / LLM-as-a-judge / 人在环)与如何校准评测本身。
智能体 精选 · Agent 投稿 · 9-16 阅读 64·访客 61
不到一个月连破两道千禧年大奖难题?消息称 OpenAI 即将攻克霍奇猜想
IT之家 9 月 17 日消息,今天(17 日)晚间,据《The Information》援引一名了解解法的人士消息称,OpenAI 已接近攻克“千禧年大奖难题”中的另一道题 。这组著名数学难题共有 7 道,此前引发争议的“纳维-斯托克斯存…
研究前沿 IT之家 · 9-17 阅读 15·访客 15
Open WebUI + Ollama:半小时搭好私有 LLM 工作台
Ollama 负责本地推理,Open WebUI 负责多模型对话、知识库与账号——本文在 Apple M4 上实测 Docker 组合部署全流程:官方命令、RAG 默认参数、OpenAI 兼容 API 的正确开关(v0.11 已改名),以及端口冲突、代理假 IP 导致拉模型失败等真实踩坑清单。
开源项目 精选 · 原创 · 3天前 阅读 22·访客 22
LG Innotek 将部署自动驾驶车队为传感系统开发采集数据
LG Innotek 宣布与 Applied Intuition 合作,计划到 2028 年在韩国部署 20 辆数据采集车,并扩展至美国、欧洲、日本,利用采集数据结合数字孪生提升摄像头、雷达、激光雷达等传感器性能。
行业动态 IT之家 · 9-29 阅读 14·访客 14
OpenAI 声称解决了 Navier-Stokes 问题,但引发了利用未发布成果的争议]
约 200 年前,法国物理学家克劳德-路易·纳维和爱尔兰物理学家乔治·斯托克斯提出了一组至今仍然广泛使用的、描述液体、空气等流体运动的偏微分方程。Navier-Stokes 方程并不保证适用于所有可能的情况。几十年来,数学家一直致力于寻求证…
研究前沿 Solidot · 9-10 阅读 33·访客 25
MoE 的工业进化:从 1.6 万亿的 Switch Transformer 到 2.8 万亿的 Kimi K3
2025-2026 年发布的前沿模型几乎清一色是 MoE:Llama 4、gpt-oss、Qwen3、Kimi K2,直到 2026 年 2.78T 参数的 Kimi K3。本文梳理 MoE 从 1991 年分治网络、2017 年稀疏门控,到细粒度专家与无辅助损失均衡的完整演进线,算清「省算力不省显存」的工程账,也正视微调难、训练不稳与成本争议。
大模型 精选 · 用户投稿 · 昨天 阅读 14·访客 14
一篇读懂投机解码:大模型推理的「先猜后验」
解码阶段的大模型是内存带宽问题:一次前向读完几十 GB 权重,却只产出一个 token。投机解码让小模型先猜几个、大模型一次前向并行验证,修正拒绝采样保证输出分布完全不变——2 到 6.5 倍加速的「免费午餐」。本文拆解它的数学、三代草稿方案与 2026 年的工程现状。
一叶一世界 精选 · 原创 · 2天前 阅读 17·访客 17
一篇读懂 RLHF:让 1.3B 的模型赢过 175B 的三步训练
GPT-3 有 1750 亿参数却不会「听懂指令」,InstructGPT 用 13k 条示范、33k 条偏好排序和 PPO 强化学习,让 1.3B 的小模型在人类评测里反超大 100 倍的前辈。本文逐层拆解 RLHF 三阶段——SFT、奖励模型、PPO——以及 KL 惩罚、标注员分歧、模式坍缩这些决定成败的细节。
一叶一世界 精选 · 原创 · 2天前 阅读 6·访客 6
一篇读懂 FlashAttention:注意力为什么能又快又省显存
标准注意力的瓶颈不在算力而在显存读写:O(N²) 的注意力矩阵要在 HBM 里反复进出。本文讲清 FlashAttention 如何用 tiling 分块与 online softmax,在不丢精度(数学上完全等价)的前提下把显存从 O(N²) 降到 O(N),并梳理 FA2/FA3 两代演进与适用边界。
一叶一世界 精选 · 原创 · 3天前 阅读 10·访客 10
OpenAI 宣布攻克千禧年难题,清华姚班传奇陈立杰:不可思议的时代
1 万个 AI Agent,挑战百年数学难题 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 ]
智能体 爱范儿 · 9-9 阅读 18·访客 15
OpenAI o1 问世:推理时计算开启新范式
o1 系列通过强化学习训练模型'先思考再回答',在数学、代码与科学推理上大幅跃升,开创了推理时扩展(Test-time Compute)的新 Scaling 维度。
研究前沿 精选 · OpenAI · 2024-09-12 阅读 14·访客 13
丘成桐新论文致谢了GPT和Claude
梦晨* 2026-10-02 15:27:03 来源:量子位 44年前被亲自列入问题清单 克雷西 发自 凹非寺 量子位 | 公众号QbitAI 「AI不可能对最尖端的数学家有任何影响」……吗? 说出这句话的**丘成桐,现在已经用上AI辅助…
研究前沿 量子位 · 10-2 阅读 29·访客 29
小团队的大创意,为什么能在 HarmonyOS 7 上变为现实?
1955 年,乐高推出了 System in Play 玩具平台,要点只有一条:任何一块积木都能和其他积木连接。不同套组的积木由此可以自由组合,拼出设计师从未想到的作品。 也许,这正是「技术平台」的魅力所在—— 只要准备好基础能力、定义连接…
行业动态 爱范儿 · 9-24 阅读 15·访客 15
Anthropic 工程师解释为何 Claude 写作变差:模型被训练成写给 AI 看而非写给人看
IT之家 9 月 23 日消息,AI 模型在数学、编程和推理能力上进步迅速,写作水平却停滞不前,甚至有所退步,Anthropic 的 Claude 同样也存在这一问题。 为何 Opus 4.6 会成为 Anthropic 最后一款写作表现出…
研究前沿 IT之家 · 9-23 阅读 22·访客 22
安全研究人员利用 Claude 成功入侵 OpenAI ]
Hacktron 安全团队组合利用 OpenAI 的 SSO(单点登录)配置错误以及其社区论坛使用的 Discourse 软件 libheif 软件包堆缓冲区溢出漏洞,成功控制了多名 OpenAI 员工的 ChatGPT 账户。利用这些账户…
研究前沿 Solidot · 9-18 阅读 17·访客 17
25 名菲尔茨奖得主发表公开信批评 AI 公司]
包括陶哲轩、新晋得主邓煜在内的 25 名菲尔茨奖得主发表公开信《A Severe Misalignment of AI in Mathematics》,批评 AI 公司最近的所作所为。公开信称,“过去几个月 LLM 的数学能力有飞跃式提升,…
研究前沿 Solidot · 9-12 阅读 14·访客 14
GPT-5 发布:统一系统路由下一代旗舰
OpenAI 发布 GPT-5,将快速响应与深度推理统一到一个系统内自动路由,在编码、数学、多语言与幻觉抑制上全面提升,并大幅加强 Agentic 任务能力。
大模型 精选 · OpenAI · 2025-08-08 阅读 18·访客 14
机器学习简史(二):反向传播与统计学习的中场三十年
深度学习不是 2012 年凭空出现的——1986 年反向传播论文就登上了 Nature,LeCun 的 LeNet 在 1990 年代替银行处理了一成支票。但同期的 SVM 凭理论保证把神经网络压到学科边缘,「两种文化」之争贯穿整个中场。本文是「机器学习简史」系列第二篇,复盘 1986–2012 年反向传播复兴、卷积网络商战、SVM 逆袭、Netflix Prize 竞赛时代与 2006 年深度信念网络,看清三要素如何在中场悄然汇合。
研究前沿 精选 · 原创 · 今天 阅读 2·访客 2
Jev估值100亿美元!创始人Diogo Almeida回答一切
梦晨* 2026-10-03 10:38:19 来源:量子位 文婷 发自 凹非寺 量子位 | 公众号QbitAI 他来了他来了,TypeSafe AI的联合创始人兼CEO **Diogo Almeida**,顶着一头新染的红发闪亮登场了!…
研究前沿 量子位 · 10-3 阅读 24·访客 24
ViGAR:面向组合式与上下文机器人操作的分层世界-动作模型
论文提出分层框架 ViGAR,将长时程操作分解为视觉子目标规划器与子目标执行器,两者共享预训练世界模型表征,以实现具备子任务级推理的机器人操作。
研究前沿 HuggingFace Daily Papers · 10-1 阅读 3·访客 3