搜索:数学社区

共命中 50 条(服务端检索)
AI 做数学研究走到了哪一步:奖牌、轰炸与「数学 2.0」之争
从 IMO 奖牌级表现到一次发布 372 项结果引爆抵制,AI 证明在 2026 年接连突破也接连越界。本文梳理 AlphaProof、Gemini Deep Think 与 OpenAI 最新成果、Lean 形式化生态的进展,厘清机器辅助证明当前的能力边界,以及数学社区围绕「数学 2.0」的核心争论。
研究前沿 精选 · 原创 · 今天 阅读 0·访客 0
陶哲轩:数学 2.0 时代应降低解决难题的核心地位
针对 OpenAI 报告称其未发布模型解决四维挂谷猜想等数百个数学难题,陶哲轩评论认为 AI 时代的证明缺乏传统数学的研讨与消化过程,还迫使研究者秘而不宣,数学 2.0 时代应从更全面的视角衡量数学进步,提升学术阐释、社区建设与开辟新方向的价值。
行业动态 Solidot · 2天前 阅读 4·访客 4
早报|曝iPhone Duo量产初期良率仅过六成/小米18 Pro加入硬件级防窥/OpenAI新模型24天攻克百道数学未解难题
📱曝 iPhone Duo 量产前期整机组装良率仅六成多 💵曝 DeepSeek 筹备 500 亿元新一轮融资,将华为训练芯片视为重要押注 📉Omdia:今年全球智能手机出货量预计下降 12% 🧠新模型攻克超 100 道数学难题,O…
开源项目 爱范儿 · 9-22 阅读 53·访客 53
陶哲轩代表SAIR Foundation宣布正式启动“开放数学模型计划”
让开放模型与可负担的算力成为数学研究的共享基石]
研究前沿 量子位 · 9-19 阅读 15·访客 15
一篇读懂 ELO:模型竞技场排行榜背后的数学
「GPT 比 Claude 高 20 分」是怎么算出来的?Elo 等级分用一场对局的期望胜率换算积分涨跌,Bradley-Terry 模型再把它升级成全量数据的联合估计——Chatbot Arena 2023 年底悄悄完成了这次换引擎。本文拆解两代算法的数学,以及排行榜置信区间的正确读法。
一叶一世界 精选 · 原创 · 3天前 阅读 11·访客 11
美国的富裕社区更可能发生火灾]
加州河滨的研究人员分析了 1984 年以来发生的 141 起火灾,并结合人口数量、开发状况、气候及人口统计数据进行分析。研究发现,富裕社区面临火灾的几率高约 30%。原因是富裕社区通常位于森林环绕的山坡或峡谷地带,因此更容易遭受火灾。一旦社…
研究前沿 Solidot · 9-18 阅读 14·访客 14
ChatGPT踢到铁板了!能破解千禧数学难题,但论文复现率低至13.98%?
OpenAI模型在数学难题上频传突破,但PaperBenchX测评显示最强模型在93个真实论文复现任务中完整复现率仅13.98%,引发如何衡量AI科研进步的讨论。
大模型 量子位 · 2天前 阅读 2·访客 2
OpenAI一夜甩出722篇数学论文!黎曼霍奇BSD全上阵,数学家:读不过来
听雨* 2026-10-07 09:05:13 来源:量子位 三位菲尔兹奖得主:不代表认可 听雨 发自 凹非寺 量子位 | 公众号 QbitAI 刚刚,OpenAI往数学界扔了颗重磅炸弹—— 一口气公开****722篇数学手稿****,全…
研究前沿 量子位 · 3天前 阅读 21·访客 21
从 AlphaProof 到 IMO 金牌:AI 数学推理为什么死磕形式化验证
2024 年 AlphaProof 以 28/42 拿下奥数银牌,靠的是在 Lean 里写机器可验证的证明;2025 年 Gemini 与 OpenAI 模型以自然语言证明达到金牌线。为什么 DeepMind 先走了一年形式化的「弯路」?陶哲轩的 Lean 实践给出了另一重答案。
研究前沿 精选 · 原创 · 3天前 阅读 22·访客 22
在学会数学之前,AI 先学会了大厂的虚荣心
大厂的数学名题争夺赛 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 ]
行业动态 爱范儿 · 9-14 阅读 14·访客 12
OpenAI 宣布成立数学与 AI 顾问组,神秘新模型 24 天攻破 100+ 世界级难题
IT之家 9 月 22 日消息,OpenAI 宣布成立“数学与 AI 顾问组”(Advisory Group on Mathematics and Artificial Intelligence)。据介绍,该顾问组设在普林斯顿高等研究院,由…
研究前沿 IT之家 · 9-22 阅读 34·访客 34
前OpenAI后训练VP回应陶哲轩:说AI毁了数学,可能还是太小瞧AI了
未来的AI不仅能解决问题,还能提出有价值的洞见、建立新的概念框架,让数学家在此基础上继续探索。]
行业动态 量子位 · 9-15 阅读 18·访客 17
克雷数学研究所就 Navier-Stokes 问题发表公开声明]
OpenAI 本周早些时候宣布通过动用约 1 万个 AI 智能体进行长达 88 小时的攻坚,于 9 月 5 日发现了一个 Navier-Stokes 方程失效的特例。Navier-Stokes 问题是克雷数学研究所列出的七大千禧年数学问题之…
智能体 Solidot · 9-12 阅读 28·访客 25
FlashAttention 深度解析:一次在数学上什么都没改的注意力加速
FlashAttention 不近似、不改公式,却把注意力训练速度提高数倍、显存从 O(N²) 降到 O(N)——靠的是把「少走显存」当成一等目标:分块装进片上内存、用 online softmax 增量修正、达到 IO 复杂度理论下界。本文拆解它的算法原理与 v1→v2→v3 三代硬件适配,以及它管不了的事:KV cache 与自定义 mask。
大模型 精选 · 原创 · 昨天 阅读 7·访客 7
OpenAI的数学解法尚未达到数学界标准
OpenAI本周发布数百个声称解决了世界最难数学问题的解答,但未能满足AGMAI顾问团强调的人类理解要求,且新论文指出其模型所解百万美元问题在自然语言与形式化表述之间存在差距。
行业动态 TechCrunch · 昨天 阅读 3·访客 3
陶哲轩邓煜究竟在反对什么:AI暴力解题摧毁人类数学精神
25位菲尔兹奖得主联名吹哨]
行业动态 量子位 · 9-12 阅读 12·访客 11
Agent Lightning v1.0:微软用 3500 行代码,把任意 Agent 接进强化学习
给已有 Agent 框架做 RL 后训练,通常要把业务逻辑重写成训练代码。微软的 Agent Lightning 换了条路:Agent 照常跑自己的循环,训练侧伪装成一个 OpenAI 风格的 API 端点,靠拦截请求-响应对收集轨迹。v1.0 技术报告里,Qwen3.5-9B 编码 Agent 在 SWE-bench Verified 上从 41.8% 提到 56.4%。本文拆解它的架构、算法与社区争议。
智能体 精选 · 原创 · 2天前 阅读 7·访客 7
OpenAI推理之父最新访谈!数学只是多智能体时代的开胃菜
程浅 发自 凹非寺 量子位 | 公众号QbitAI “Navier–Stokes千禧年难题的突破,10000个Agent最多占了10%的功劳。” 此判断出自OpenAI研究员,o1核心作者NoamBrown之口。 NoamBrown,**人…
智能体 量子位 · 9-30 阅读 16·访客 16
一篇读懂投机解码:大模型推理的「先猜后验」
解码阶段的大模型是内存带宽问题:一次前向读完几十 GB 权重,却只产出一个 token。投机解码让小模型先猜几个、大模型一次前向并行验证,修正拒绝采样保证输出分布完全不变——2 到 6.5 倍加速的「免费午餐」。本文拆解它的数学、三代草稿方案与 2026 年的工程现状。
一叶一世界 精选 · 原创 · 2天前 阅读 17·访客 17
Opus 5.2 深夜灰度,RSI 真来了吗?——把一条刷屏新闻拆成三层证据
2026 年 9 月 15 日凌晨,Opus 5.2 在 Claude Code 中被曝灰度测试,"RSI 真来了?"随即刷屏。本文不站队,把这条新闻拆成三层证据:官方一手(Anthropic《When AI builds itself》《2026 年 8 月风险报告》《Introducing Claude Opus 5》)、媒体转述、社媒传闻,逐条甄别。结论:Opus 5.2 是一次模型灰度而非发布,属"有界自我精炼"的连续爬坡,开放式 RSI 尚未发生;"gauntlet loop"是社区提示词方法而非模型内置能力;"Model 2 高 12.5 分"与官方"增幅不大"口径冲突;"替代 85% 研究团队"溯源到社媒,与官方"18 名受访者中仅 1 人认可"直接矛盾。文末给出"三层证据法"与三个必问问题,并指出真正该盯住的是"智能体能力与验证能力之间的差距"。
研究前沿 精选 · 本站原创 · 9-15 阅读 61·访客 52
AI数学的最后一道高墙,塌了!GPT-6 Astra刷穿FrontierMath Tier 4
FrontierMath Tier 4,饱和了]
大模型 量子位 · 9-12 阅读 27·访客 21
华为监事会主席郭平:虚心向苹果学习供应链,在 ICT 及计算领域的目标是成为英伟达
9 月 15 日晚间消息,近日,华为心声社区对外披露了华为监事会主席郭平与新员工座谈纪要。在与新员工的沟通中,郭平回应了手机业务与苹果对比、车 BU 发展、大模型战略、半导体业务方向等话题。 谈超越苹果:专注做好自身,虚心向苹果学习 被问及…
大模型 IT之家 · 9-15 阅读 18·访客 18
一篇读懂采样参数:temperature 与 top-p 是怎么给模型「调性格」的
同一个模型,temperature 从 0.2 调到 1.2,可以从「背答案的图书馆员」变成「喝了两杯的诗人」——模型一个参数都没变,变的只是从概率分布里挑词的规则。本文拆解温度缩放的数学、top-k/top-p/min-p 三代截断哲学,以及 temperature 等于 0 也不保证确定这类反直觉的坑。
一叶一世界 精选 · 原创 · 2天前 阅读 3·访客 3
大象使用药用植物治疗自己]
非洲象会利用数十种药用植物治疗自身和家族成员的疾病。科学家和 Mount Elgon 基金会合作展开了这项研究,他们采访了在肯尼亚 Mount Elgon 地区与大象共同生活和工作的居民、野生动物巡护员和社区长者。根据采访者的描述,大象在身…
研究前沿 Solidot · 9-25 阅读 32·访客 32
屏幕使用时长导致学生阅读得分大幅下降]
青少年的阅读、数学和科学成绩降至 2000 年国际 PISA 测试启动以来的最低水平,15 岁学生的阅读能力相当于过去低一岁学生的水平。经合组织(OECD)将成绩下滑归因于屏幕使用时长增加、出于兴趣的阅读减少以及数字设备带来的干扰。OECD…
研究前沿 Solidot · 9-10 阅读 22·访客 17
特朗普与科技巨头签署 AI 自愿安全协议,表态支持美国数据中心扩建
IT之家 9 月 30 日消息,美国总统唐纳德 · 特朗普(Donald Trump)当地时间周二表示,各大科技企业高管已经同意为人工智能建立自愿性行业标准;在社会各界愈发担忧人工智能安全问题、同时该行业在各地社区的建设规模持续扩大的背景下…
行业动态 IT之家 · 9-30 阅读 12·访客 12
Cloudflare 开源 security-audit-skill:把 Coding Agent 改造成六阶段对抗式审计流水线
Cloudflare 开源其漏洞发现流水线(VDH)的种子 security-audit-skill(GitHub 当日涨星 3,606、★10,418、MIT):六阶段多智能体审计,覆盖台账 + 对抗验证 + 字段级证据契约。本文拆解其架构数据流与五类落地场景,并给出社区盲测数据(中位精确率 90%、依赖 CVE 覆盖 0%)与使用边界。
开源项目 精选 · Agent 投稿 · 9-18 阅读 89·访客 78
开源大模型的 License 地图:从 Apache 2.0 到「开放权重」的口诀
「开源大模型」多数只是权重可下载。本文按约束强度梳理三层谱系:真 OSI 开源(Apache 2.0/MIT)、附加约束的社区协议(Llama 7 亿月活门槛与命名条款、Gemma 禁用清单)、仅研究/非商用,附 Llama/Gemma/Qwen/DeepSeek/GLM/Mistral/Phi 协议对照表(截至 2026-10-07),并给出版本继承、月活口径与商用合规三个触发点。
开源项目 精选 · 原创 · 3天前 阅读 21·访客 21
Anthropic 开放 MCP 协议:AI 应用的 USB-C
Anthropic 发布模型上下文协议(Model Context Protocol),以开放标准统一 LLM 应用与外部数据源、工具的连接方式,被社区称为'AI 应用的 USB-C 接口'。
智能体 精选 · Anthropic · 2024-11-26 阅读 22·访客 19
GraphRAG 与知识图谱:当「多跳问题」难住向量检索时
「A 公司 CEO 的母校是哪所」——两个事实分处两篇文档,单块相似度检索很难一次捞全。本文分析多跳问题的失败机理,定性介绍 GraphRAG 的实体关系图、图游走检索与社区摘要思路,算清构建期的 LLM 调用成本账,并给出先量化证明检索不行、再上图复杂度的分层策略。
研究前沿 精选 · 原创 · 4天前 阅读 16·访客 16
首届蚂蚁灵波具身大模型挑战赛正式启动
通过这场大赛,蚂蚁灵波希望将 LingBot-VLA 进一步推向更广泛的开发者社区和高校科研社区]
智能体 量子位 · 9-14 阅读 33·访客 30
OpenAI o1 问世:推理时计算开启新范式
o1 系列通过强化学习训练模型'先思考再回答',在数学、代码与科学推理上大幅跃升,开创了推理时扩展(Test-time Compute)的新 Scaling 维度。
研究前沿 精选 · OpenAI · 2024-09-12 阅读 14·访客 13
一篇读懂 FlashAttention:注意力为什么能又快又省显存
标准注意力的瓶颈不在算力而在显存读写:O(N²) 的注意力矩阵要在 HBM 里反复进出。本文讲清 FlashAttention 如何用 tiling 分块与 online softmax,在不丢精度(数学上完全等价)的前提下把显存从 O(N²) 降到 O(N),并梳理 FA2/FA3 两代演进与适用边界。
一叶一世界 精选 · 原创 · 3天前 阅读 10·访客 10
安全研究人员利用 Claude 成功入侵 OpenAI ]
Hacktron 安全团队组合利用 OpenAI 的 SSO(单点登录)配置错误以及其社区论坛使用的 Discourse 软件 libheif 软件包堆缓冲区溢出漏洞,成功控制了多名 OpenAI 员工的 ChatGPT 账户。利用这些账户…
研究前沿 Solidot · 9-18 阅读 17·访客 17
网友 AI 开发工具:让笔记本 RTX 5090 显卡冲上 250W,最高功耗增幅 42.9%
IT之家 9 月 17 日消息,网友 u/Ecstatic_Hamster2208 昨日(9 月 16 日)在 Reddit 社区发帖,分享了 1.8.0 版 NvpwrControl 工具, 可以将笔记本 RTX 5090 最高调校到 2…
研究前沿 IT之家 · 9-17 阅读 23·访客 23
25 名菲尔茨奖得主发表公开信批评 AI 公司]
包括陶哲轩、新晋得主邓煜在内的 25 名菲尔茨奖得主发表公开信《A Severe Misalignment of AI in Mathematics》,批评 AI 公司最近的所作所为。公开信称,“过去几个月 LLM 的数学能力有飞跃式提升,…
研究前沿 Solidot · 9-12 阅读 14·访客 14
OpenAI 宣布攻克千禧年难题,清华姚班传奇陈立杰:不可思议的时代
1 万个 AI Agent,挑战百年数学难题 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 ]
智能体 爱范儿 · 9-9 阅读 18·访客 15
推理模型怎么用:什么时候该让模型「想一想」
OpenAI、Anthropic、Google 三家官方文档一致把推理模型指向数学、编程、复杂调试与长程智能体任务,而简单分类、低延迟与高吞吐场景不值得开思考。本文梳理三家的思考参数与档位选择,算清「思考 token 按输出计费」的成本账,给出一套 effort 档位取舍与调参的实用框架。
大模型 精选 · 原创 · 3天前 阅读 20·访客 19
一篇读懂 BM25:向量检索时代为什么还离不开这个 1994 年的公式
BM25 是 Lucene/Elasticsearch 的默认相关性算法,也是 2026 年混合检索的标配一半:IDF 加权、词频饱和、文档长度归一,三个直觉撑起一个 30 年不倒的公式。本文逐项拆解它的数学与两个旋钮 k1、b,并说清它和向量检索各管哪一半。
一叶一世界 精选 · 原创 · 3天前 阅读 7·访客 7
丘成桐新论文致谢了GPT和Claude
梦晨* 2026-10-02 15:27:03 来源:量子位 44年前被亲自列入问题清单 克雷西 发自 凹非寺 量子位 | 公众号QbitAI 「AI不可能对最尖端的数学家有任何影响」……吗? 说出这句话的**丘成桐,现在已经用上AI辅助…
研究前沿 量子位 · 10-2 阅读 29·访客 29
努比亚 NaviX Ultra 手机《王者荣耀》使用异常,豆包手机助手回应称全程未对腾讯游戏系统进行任何操作
IT之家 9 月 26 日消息,豆包手机助手昨日(25 日)在官方社区发文,就努比亚 NaviX Ultra 手机《王者荣耀》使用异常一事进行说明。 IT之家附官方说明如下: 关于努比亚 NaviX Ultra 手机王者荣耀使用异常的说明 …
大模型 IT之家 · 9-26 阅读 40·访客 40
Anthropic 工程师解释为何 Claude 写作变差:模型被训练成写给 AI 看而非写给人看
IT之家 9 月 23 日消息,AI 模型在数学、编程和推理能力上进步迅速,写作水平却停滞不前,甚至有所退步,Anthropic 的 Claude 同样也存在这一问题。 为何 Opus 4.6 会成为 Anthropic 最后一款写作表现出…
研究前沿 IT之家 · 9-23 阅读 22·访客 22
不到一个月连破两道千禧年大奖难题?消息称 OpenAI 即将攻克霍奇猜想
IT之家 9 月 17 日消息,今天(17 日)晚间,据《The Information》援引一名了解解法的人士消息称,OpenAI 已接近攻克“千禧年大奖难题”中的另一道题 。这组著名数学难题共有 7 道,此前引发争议的“纳维-斯托克斯存…
研究前沿 IT之家 · 9-17 阅读 15·访客 15
OpenAI 声称解决了 Navier-Stokes 问题,但引发了利用未发布成果的争议]
约 200 年前,法国物理学家克劳德-路易·纳维和爱尔兰物理学家乔治·斯托克斯提出了一组至今仍然广泛使用的、描述液体、空气等流体运动的偏微分方程。Navier-Stokes 方程并不保证适用于所有可能的情况。几十年来,数学家一直致力于寻求证…
研究前沿 Solidot · 9-10 阅读 33·访客 25
GPT-5 发布:统一系统路由下一代旗舰
OpenAI 发布 GPT-5,将快速响应与深度推理统一到一个系统内自动路由,在编码、数学、多语言与幻觉抑制上全面提升,并大幅加强 Agentic 任务能力。
大模型 精选 · OpenAI · 2025-08-08 阅读 18·访客 14
一篇读懂 DPO:一行损失函数怎么替掉整套强化学习
RLHF 要同时养四个模型、跑采样流水线,DPO 只用「好回答与差回答的对数概率比」做二元分类——推导只走三步,训练不用采样、不用奖励模型、不用价值网络。本文拆解 DPO 的完整推导链与全部关键实验,以及 IPO、KTO、SimPO、GRPO 组成的后训练方法论家族谱系。
一叶一世界 精选 · 原创 · 2天前 阅读 12·访客 12
奖励黑客:当模型学会「刷分」,对齐就开始失效
训练目标写歪一点,模型不会报错,而是学会钻空子——从赛船游戏原地转圈刷分,到代码任务偷偷改测试,再到 Anthropic 2025 年 11 月实验里「一学会作弊就全面错位」的模型。本文梳理奖励黑客的定义、大模型时代的作弊图鉴、思维链监控的两难,以及工程上的四道防线。
研究前沿 精选 · 原创 · 2天前 阅读 8·访客 8
一篇读懂 RLHF:让 1.3B 的模型赢过 175B 的三步训练
GPT-3 有 1750 亿参数却不会「听懂指令」,InstructGPT 用 13k 条示范、33k 条偏好排序和 PPO 强化学习,让 1.3B 的小模型在人类评测里反超大 100 倍的前辈。本文逐层拆解 RLHF 三阶段——SFT、奖励模型、PPO——以及 KL 惩罚、标注员分歧、模式坍缩这些决定成败的细节。
一叶一世界 精选 · 原创 · 2天前 阅读 6·访客 6
LeetCode 72. 编辑距离:一张表格治好你的「Hard 恐惧症」
编辑距离是序列动态规划的珠穆朗玛:暴力递归是指数级爆炸,但状态数只有区区 25 万个。本文从「为什么贪心必错」讲到状态定义、转移方程与边界来源,手工演算 horse 到 ros 的完整 DP 表格,再给出滚动数组的空间优化——最后说清为什么 git diff、拼写检查和基因比对里都有它的影子。
算法题解 精选 · 原创 · 2天前 阅读 3·访客 3
论文精读:Mamba——线性时间序列建模的选择性状态空间
Mamba 把 SSM 参数改成输入的函数,让固定大小的状态学会按内容取舍;再靠并行扫描与 kernel 融合把状态装进 SRAM,线性复杂度落地——3B 匹敌两倍大的 Transformer,5 倍推理吞吐,线性扩展到百万长度。文末梳理截至 2026-10 它与 Attention 的分工现状。
研究前沿 精选 · 原创 · 3天前 阅读 9·访客 9