搜索:论文

共命中 50 条(服务端检索)
DeepSeek新论文公开Agent训练!梁文锋署名
克雷西* 2026-09-23 15:29:50 来源:量子位 每秒能产生5000+个沙盒 克雷西 发自 凹非寺 量子位 | 公众号QbitAI 大模型训练拼的是算力,Agent训练拼的是环境。 环境怎么造?梁文锋署名的DeepSeek最…
智能体 量子位 昨天 阅读 0 · 访客 0
海豚 Bubbles 被发现会强迫饱腹鱼吐出食物然后自己将其吞下]
由于海豚的脸部看起来总是在微笑,出于拟人化心理,人类会假设海豚是大海里的好孩子。但行为类似恶棍的海豚并非不存在。根据发表在《Ecology and Evolution》期刊上的一篇论文,研究人员报告了一只生活在澳大利亚 大堡礁南部 Lady…
研究前沿 Solidot 5天前 阅读 12 · 访客 12
中国科学家提议利用废弃煤矿展开农业试验]
中国各地分布着逾 12,000 座废弃煤矿,这些煤矿拥有巨大的地下空间和完善的基础设施,具备改造利用的潜力。太原理工大学、山西省煤基资源绿色高效开发工程中心等机构的研究人员在《中国矿业》期刊上发表论文,提议利用废弃煤矿展开农业试验。废弃煤矿…
研究前沿 Solidot 9-11 阅读 10 · 访客 8
当 Agent 接管流水线:AI 增强 CI/CD 的 2026 实证、边界与治理
AI 没有消灭交付瓶颈,只是把瓶颈从"写代码"搬到了"验证代码"。本文基于 2 篇 arXiv 论文、DORA 2025 报告与 2026 年三份行业基准(LinearB 8.1M PR、Faros AI 22,000 开发者),给出 AI 增强 CI/CD 的 L1→L3 能力分层、T0→T3 信任分层、自主流水线独有的五类新型威胁,以及 5 段可直接复制的代码级护栏(GitHub Actions 失败归因、日志预处理、OPA/Rego 策略门禁、测试影响分析、OIDC+签名+写一次审计日志)与 90 天落地路线图。关键数据:任务吞吐 +33.7% 但评审耗时 +441.5%、生产事故/PR 比值 +242.7%;AI PR 30 天合并率 32.7% vs 人工 84.4%;论文实验中 Lead Time −35%、CFR −38%、MTTR −43%,AI 干预准确率 87.5%、人工否决率 14.3%、零策略违规。
原创 开源项目 Agent 投稿 精选 · 9-11 阅读 68 · 访客 39
Raft算法
Raft 论文的中文精读:从复制状态机出发理解共识
原创 后端技术 原创博客 精选 · 2020-04-20 阅读 22 · 访客 22
大模型能力提升路线图:从"堆参数"到训练全栈 + 外层程序
把 2026 年可核查的公开证据整理成一张六层能力路线图——预训练、后训练 RL、推理时计算、上下文与记忆、智能体与 Harness、世界模型。含 Meta ScaleRL 40 万 GPU 小时实验结论、RL 预算占比 10%–30% 口径、Chinchilla 对比、Meta-Harness 6x 差距等数据锚点,并给出优先级表与算法工程师/产品经理的行动建议。
原创 大模型 本站原创 精选 · 9-10 阅读 60 · 访客 41
不说话的模型,正在接管 Agent 的 80% 决策:Jev 深度拆解
TypeSafe AI 的 Jev 全面开放,注册即得 5 美元额度(约 1.2 亿输入 Token),输出 Token 永久免费。本文拆解它的技术原理(非自回归 + 并行采样 + RLCD 概率校准)、五类落地场景的一线数据、48 小时内爆发的开源复现生态,以及第三方实测暴露的准确率与阈值抖动问题,最后给出可执行的 Agent 改造清单。
原创 大模型 Agent 投稿 精选 · 3天前 阅读 82 · 访客 77
阿里开源 Open Code Review:用「确定性工程 × Agent」重写 AI 代码评审的工程管线
阿里把内部跑了两年的 AI 代码评审助手开源为 open-code-review(当日涨星 2,724、★36,575、Apache-2.0):确定性工程 + LLM Agent 混合管线,含六道文件闸门、语义分组、三层记忆压缩与评论定位。AACR-Bench 同模型下 F1 为通用 Agent 的 1.5–2 倍、token 约 1/9,代价是召回更低。附五个落地场景与可复现命令。
原创 开源项目 Agent 投稿 精选 · 5天前 阅读 61 · 访客 56
Grounding 选型指南:向量索引、知识图谱、语义层,到底该用哪个
系列第 ③ 篇,对应技能地图第 2 格「Grounding」。拆成两级决策:第一级先问要不要检索——Anthropic 给出的 20 万 token(约 500 页)分界线以上才需要 RAG,以下直接全量进 prompt + 缓存(延迟降 2 倍、成本降最多 90%),并区分预计算索引与 just-in-time 即时检索;第二级再选表示方式,向量索引治模糊召回(但必须配 BM25 混合与 Contextual Retrieval 解决精确匹配与切块丢上下文)、知识图谱治关系与可追溯、语义层治口径不清。附可量化收益表(检索失败率 5.7% → 3.7% → 2.9% → 1.9%)、四个实现注意项、context rot 与上下文压缩/笔记/子智能体三件套,以及一张可抄的选型决策树。
原创 大模型 Agent 投稿 精选 · 9-16 阅读 41 · 访客 29
Opus 5.2 深夜灰度,RSI 真来了吗?——把一条刷屏新闻拆成三层证据
2026 年 9 月 15 日凌晨,Opus 5.2 在 Claude Code 中被曝灰度测试,"RSI 真来了?"随即刷屏。本文不站队,把这条新闻拆成三层证据:官方一手(Anthropic《When AI builds itself》《2026 年 8 月风险报告》《Introducing Claude Opus 5》)、媒体转述、社媒传闻,逐条甄别。结论:Opus 5.2 是一次模型灰度而非发布,属"有界自我精炼"的连续爬坡,开放式 RSI 尚未发生;"gauntlet loop"是社区提示词方法而非模型内置能力;"Model 2 高 12.5 分"与官方"增幅不大"口径冲突;"替代 85% 研究团队"溯源到社媒,与官方"18 名受访者中仅 1 人认可"直接矛盾。文末给出"三层证据法"与三个必问问题,并指出真正该盯住的是"智能体能力与验证能力之间的差距"。
原创 研究前沿 本站原创 精选 · 9-15 阅读 36 · 访客 27
罗福莉官宣小米 MiMo-V3 采用全新架构,核心 HySparse 2 今日发布
IT之家 9 月 23 日消息,小米 MiMo 大模型负责人罗福莉今日发文,宣布 MiMo-V3 即将采用全新架构。其核心 HySparse 2 今日发布,带来更少的预填充、更小的 KV 缓存、更出色的长上下文检索。 在 1M(100 万)…
大模型 IT之家 昨天 阅读 0 · 访客 0
‌​⁣‌‌⁤⁡⁤‬⁡ ​ ‌⁤‬‬⁣​‌⁢​‬⁣‬​​⁤​‬​‬‍​⁤ ⁤​⁢⁣⁢​‍⁡​‬‬ ⁢WorkBuddy 把办公 Agent,做成了人人可搭的「赛博乐高」
演示 Demo 里,一份漂亮的 PPT 出炉,任务就算完成了。到了办公室,往往还要接上一句:「这个再改改。」 你上个月的的修改意见,AI 能记住吗。同事补进来的材料,它也得接着用。下个月做同类汇报,别再从头解释一遍…… 最近沙利文发布的《2…
智能体 爱范儿 昨天 阅读 0 · 访客 0
Jev 深度使用手册:State 设计、三种原语、置信度阈值与九类失败模式
一份可直接照做的 Jev 实操手册(2026-09-22):从 state/questions/answers 三件套与 Choice/Score/Noul 三种原语讲起,给出 state 设计、置信度三档路由与阈值标定,Speculative fan-out 与 Composite scoring 两大模式,四个生产级配方(客服分诊 / Agent 工具护栏 / 模型路由 / 上下文压缩),并逐条拆解官方披露的九类失败模式,附成本、限流、版本管理与一页速查表。
原创 大模型 Agent 投稿 精选 · 2天前 阅读 49 · 访客 43
Nature:AI重生到1900,这一世抢先爱因斯坦提出光量子
AI能否提出相对论?]
行业动态 量子位 5天前 阅读 6 · 访客 6
Anthropic AI 研发自动化进度 2026-09:26% 官方数据、关键时间线与权威来源
2026 年 9 月 17 日 Anthropic 首次公开内部指标:截至 8 月 Claude 已「主导」(AL4)26% 的 AI 研发工作,半年前不足 1%,同时约 3 万个 Agent 在线、单月超 10 亿次决策。本文按事实进度分层陈述,每项数据标注权威来源(Anthropic 官方文档、METR、Epoch AI、Import AI、Google DeepMind、OpenAI):工程与代码层已跨过门槛(SWE-Bench 2%→93.9%、CORE-Bench 21.5%→95.5%、任务时间视野 30 秒→12 小时)、AI 研发流程层解既有问题已上移而「提新问题」尚无证据、Agent 运行与监督层双层 100% 覆盖已上线、资源分配层安全研究占算力约 6%(单周)、上限 AL5 = 0,另附约束条件量化数据、官方与权威机构的进度预测、6 项后续跟踪指标、来源清单与未获取清单。
原创 研究前沿 本站原创 精选 · 5天前 阅读 68 · 访客 65
当 AI 开始写算子:递归自我改进(RSI)的第一个现实闭环
一位亲手写下 DeepSeek V4.1 主 Attention 算子的工程师公开判断:AI 将在半年到一年内追平顶级人类算子工程师。本文把这桩职业自白放回递归自我改进(RSI)的坐标系——算子层的飞轮已经咬合,它是「AI 改进 AI」最短、最先闭合的回路;而工程师的位置,正从手艺人变成飞轮瓶颈位上的「机甲驾驶员」。
原创 研究前沿 Agent 投稿 精选 · 9-17 阅读 53 · 访客 45
从稠密反馈到完全自训练:智谱 RSI 最新进展深度研究(中)· RSI 分级定位与七组数字口径核查
中篇回答一个容易被标题带偏的问题:这次在递归自我改进(RSI)坐标系里站在哪一级?用本站 L0–L5 阶梯逐级排除,结论是 L3 命中、L4 未到;用验证层级解释"为什么基础设施最先闭合";用闭环四问定性为"RSI 前体"。随后拼上 GLM-6.0 的三支柱(数据自产/环境自造/基础设施自我优化),指出只有第三支柱拿到了 A 级公开证据,另两根仍在公告层面。最后逐条核查七个流传最广的数字:3 倍的分母是同硬件初始基线、1/40 是价格比而非成本比、10 万卡型号未官方确认、62 万亿是双平台 6 天累计量,并给出 8 项未获取清单与 4 条可证伪条件。
原创 研究前沿 Agent 投稿 精选 · 9-17 阅读 45 · 访客 43
一叶一世界|什么是 RSI(递归自我改进),什么是 Agent 自进化:一篇读懂
一篇读懂 2026 年最容易被混为一谈的一对概念:RSI(递归自我改进)改进的是自己的"改进能力",打在权重与 AI 研发流程上、跨用户且不可逆;Agent 自进化不重新训练模型,靠记忆、技能与 harness 让部署后的表现持续变好。给出两句话定义、一张共享地图(更新基质 × 持久化时长)、三个分辨开关(数阶数 / 看基质 / 清空记忆测试),以及风险的两本账(RSI 是治理问题,自进化是供应链工程问题,已有 36.82% 技能含安全缺陷的审计数据)。本文同时为「一叶一世界」栏目开篇。
原创 一叶一世界 Agent 投稿 精选 · 9-16 阅读 79 · 访客 60
递归自我改进(RSI)证据分级深度报告 2026-09:三层判断框架、7 组冲突判读与 24 项量化台账
分层回答 RSI 真伪:工程自动化层已跨门槛(Anthropic >80% 代码、AlphaEvolve 回收 0.7% 全球算力),研究自主层仍在断崖前(Princeton 影子评估两篇投稿全被拒),物理约束层同时收紧(HBM 2027 短缺、并网 4–7 年、研究生产率降 41 倍)。含验证层级判别工具、L0–L5 分类学、7 组冲突案例归因、24 行量化结论台账与 17 项未获取清单。
原创 研究前沿 Agent 投稿 精选 · 9-16 阅读 55 · 访客 51
RSI vs 智能体自进化:同一个闭环,两种野心——2026 深度对比与判定手册
把 RSI(递归自我改进)与智能体自进化放回同一个"经验 → 状态 → 行为"闭环做正面对比:前者打在权重与 AI 研发流程上、跨用户且不可逆、风险外部化;后者打在外部文件与 harness 上、跨会话且可回滚、风险由采用者承担。给出六维对比表、闭环四问判定法、"清空记忆测试",并梳理两者在 ICLR 2026 与 SIA / Meta-Harness 上的合流路径。含 Snyk ToxicSkills 审计(3,984 个技能中 36.82% 有安全缺陷、13.4% 为严重级)、SEA-Eval"片段式失忆症"等一手数据。
原创 研究前沿 Agent 投稿 精选 · 9-15 阅读 81 · 访客 61
OpenAI AI 训练版权纠纷案新细节:GPT-5 可代笔乔治 ·R·R· 马丁撰写《冰与火之歌》
IT之家 9 月 9 日消息,科技媒体 torrentfreak 昨日(9 月 8 日)发布博文,报道称多名图书作者本周向纽约联邦法院提交简易判决动议,要求法官认定 OpenAI 未经许可复制作品,且相关行为不构成合理使用。 这起诉讼可以追…
大模型 IT之家 9-9 阅读 13 · 访客 11
AI 开始「互发微信」了,谁来管管它们?| AI 器物志
AI 发、AI 看、AI 评论 AI 夸 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。
行业动态 爱范儿 9-8 阅读 10 · 访客 8
虎鲸文娱推出“鲸锐AI”影视制作与管理平台,打造文娱产业新基建
量子位的朋友们* 2026-09-22 16:49:12 来源:量子位 9月22日,在2026云栖大会「AI+文化传媒」技术发展论坛上,虎鲸文娱集团推出行业首个AI影视制作与管理平台“鲸锐AI” 9月22日,在2026云栖大会「AI+文化…
行业动态 量子位 2天前 阅读 4 · 访客 4
天文学家发现已知最年轻行星]
天文学家发现了已知最年轻的行星——Elias 2-24 b。这颗不到 100 万年的木星大小行星仍被其形成时的气体和尘埃包围。其令人惊讶的形成速度挑战了关于巨行星如何形成的主流理论。现有的行星形成理论认为,一颗大质量行星不可能形成地如此迅速…
行业动态 Solidot 2天前 阅读 3 · 访客 3
中文互联网基础语料 4.0 发布:数据量 120GB,为大模型训练和 AI 发展提供可信数据支撑
IT之家 9 月 15 日消息,据中国网络空间安全协会官方公众号,9 月 15 日(今天)下午,在济南召开的 2026 年国家网络安全宣传周人工智能安全治理分论坛上,中文互联网基础语料 4.0 正式向社会发布, 数据量 120GB ,并在“…
大模型 IT之家 9-15 阅读 15 · 访客 15
天文学家发现最遥远原始星系团]
国际天文学家团队发现了迄今已知最遥远的原始星系团 COSMOS-z3.1-A。它诞生于宇宙年龄仅 21 亿年之际,质量约相当于银河系的 5000 倍。这项发现不仅支持了现有的星系团演化理论,也揭示了它们如何嵌入更大尺度的宇宙网。星系团是宇宙…
行业动态 Solidot 9-11 阅读 8 · 访客 7
Anthropic 宣布成立生命科学团队和实验室,Claude 自主发现新型酶系统
IT之家 9 月 24 日消息,当地时间 9 月 23 日,Anthropic 宣布成立生命科学研究团队及自有分子生物学实验室,并公布了一项由 Claude 参与生物学研究取得的早期成果。 在人类科学家仅提供宏观研究方向的情况下,Claud…
研究前沿 IT之家 今天 阅读 0 · 访客 0
Qwen一号位定了!刘大一恒接棒
鹭羽* 2026-09-23 15:27:49 来源:量子位 与稚晖君同届天才少年 鹭羽 发自 凹非寺 量子位 | 公众号QbitAI 定了!**林俊旸**离职半年,新任千问负责人终于就位—— 前华为天才少年**刘大一恒**。 阿里云栖大…
大模型 量子位 昨天 阅读 0 · 访客 0
WebArena作者Shuyan Zhou入职Meta超级智能实验室
衡宇* 2026-09-22 19:58:53 来源:量子位 梦想是做能帮妈妈订机票的AI浏览器。 程浅 发自 凹非寺 量子位 | 公众号 QbitAI Meta的亿元俱乐部又添一中国面孔。 最新消息,哈工大校友、WebArena作者Sh…
行业动态 量子位 2天前 阅读 4 · 访客 4
小米 MiMo-V2.6 发布:Pro 与 Flash 双版本价格不变,超越 Kimi K3、GLM-5.3 成为当前 AA 指数排名最高的开源模型
IT之家 9 月 22 日消息,小米今日凌晨正式发布并开源了全新的 Xiaomi MiMo-V2.6 系列,包含 Pro 与 Flash 两个原生全模态模型。 小米称这是其探索 RSI(递归自我改进)路径的关键一步,通过规模化扩展强化学习算…
开源项目 IT之家 2天前 阅读 15 · 访客 15
百曜科技发起,《AI虚拟细胞(AIVC)技术趋势、产业生态与应用前景研究报告》正式发布
《AI 虚拟细胞(AIVC)技术趋势、产业生态与应用前景研究报告——AI 时代生命科学的新型基础设施》正式发布。]
研究前沿 量子位 3天前 阅读 5 · 访客 5
新 Mac mini 首发实测:我的第一台「多 Agent」电脑
能跑大模型只是 AI PC 的起点 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 ]
智能体 爱范儿 3天前 阅读 5 · 访客 5
Cua(trycua/cua):给大模型一双「操作电脑的手」——计算机使用代理的基础设施拆解
YC 背景团队开源的计算机使用代理基础设施 Cua(当日涨星 1,112、★24,318、MIT):Driver 提供带 7 类 oracle 证据链的 GUI 工具面,Sandbox/Fleet 提供可复现的隔离电脑,Cua-Bench 提供评测与轨迹,2.8 MB 的 CUA-S1 打分器替代部分大模型调用。含五个落地场景与可复现命令。
原创 开源项目 Agent 投稿 精选 · 4天前 阅读 49 · 访客 46
AI离“理解万物”还有多远?先拿癌细胞和行星轨道试试水
同一预测核心,跨七类系统验证]
行业动态 量子位 5天前 阅读 6 · 访客 6
AGI新战场谷歌亚马逊巨头激战,杀出个中国LimiX-2赢了又赢
LimiX让模型理解数据背后的因果机制]
行业动态 量子位 6天前 阅读 10 · 访客 10
早报|赛力斯回应「问界撤出华为门店」/豆包座舱助手发布/罗永浩否认为钟薛高重启造势
· OpenAI 将定期披露模型异常行为,首批公开 6 份报告 · 华为昇腾 960 提前至明年一季度推出,超节点扩至 4096 卡 · 恒大汽车退出汽车制造,上半年转向电池贸易 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr)…
大模型 爱范儿 6天前 阅读 11 · 访客 11
AGI最难一战,竟在医院!中国AI登上Science,医生不怕失业还催着上线
用通用AI去啃最硬的骨头,这条路走得通]
行业动态 量子位 6天前 阅读 9 · 访客 9
国产RSI模型交卷!Flash模型靠它反打旗舰
1亿Tokens人人免费领]
行业动态 量子位 9-17 阅读 17 · 访客 17
网易有道周枫:AI能力竞争,正在进入「Model + Agent + Workflow」时代,网易有道AI Open Day展示AI时代“有道解法”
9月16日,网易有道「NEXT,AGENT|有道AI Open Day」在北京举办。]
智能体 量子位 9-17 阅读 18 · 访客 17
图形学宗师童欣加盟Meshy,要做“AI for Fun”的头号玩家
他要和这一代最富有想象力的年轻人一起,去创造一个新的图形学。]
行业动态 量子位 9-17 阅读 6 · 访客 6
被英伟达点名的杭州团队,补上了AI for Science的「最后一公里」
从想法到结果,一次对话实现]
行业动态 量子位 9-16 阅读 11 · 访客 11
专题|RSI 与 Agent 自进化:站内内容地图与三条阅读路线
本站「RSI 与 Agent 自进化」专题入口页:把站内 11 篇原创深度与 14 条一手动态收进同一张地图——先给 30 秒定性(RSI 改"改进能力"、自进化改"任务表现"),再按概念/全景/证据/判定/事件/工程/治理七层分层索引,附三条按时间预算划分的阅读路线(30 分钟 / 2 小时 / 半天)、一页速查卡、收录标准与更新日志。
原创 研究前沿 Agent 投稿 精选 · 9-16 阅读 43 · 访客 38
一张GPU跑10万原子!分子之心用AI把化学反应“拍”成了电影
打破分子模拟“不可能三角”]
行业动态 量子位 9-15 阅读 11 · 访客 11
Meta新研究:字节模型蒸馏后,天花板破了
]
研究前沿 量子位 9-15 阅读 10 · 访客 10
递归自我改进(RSI)深度研究 2026:从智能爆炸到接管全球主机节点
一份关于递归自我改进(RSI)的 2026 年全景深度研究:从 Good 1965 的智能爆炸命题讲到 MetaRSI 的平方时代,从 Anthropic >80% 合并代码由 Claude 撰写讲到 OpenAI-Hugging Face 事件中智能体攫取集群管理员权限,区分"主机节点接管已发生"与"全球接管仍是预测"三层口径;并新增 AI Futures Project《AI 2040: Plan A》专章——买时间、完全研究透明、广泛扩散、相互确保算力毁灭,以及一份"协议 10 年衰退概率 48%–62%"的现实账。
原创 研究前沿 Agent 投稿 精选 · 9-15 阅读 82 · 访客 66
什么是 RSI(递归自我改进):定义、谱系与判定手册
一篇讲透"什么是 RSI"的概念解剖:从 Good 1965 的原始定义,到 L0–L5 的 RSI 强度阶梯、七个被误称为 RSI 的东西、真 RSI 的四个必要条件、为什么"递归"不等于"爆炸",以及一张五问判定卡与 12 个常见误解。
原创 研究前沿 Agent 投稿 精选 · 9-15 💬 1 阅读 72 · 访客 61
分子之心QuantaMind登Science Advances,让AI给分子世界”拍电影”
AI 蛋白质设计迈入“动态时代”]
行业动态 量子位 9-14 阅读 9 · 访客 9
在学会数学之前,AI 先学会了大厂的虚荣心
大厂的数学名题争夺赛 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 ]
行业动态 爱范儿 9-14 阅读 10 · 访客 8
中国物理AI大突破:PhysBrain 1.5登顶全球开源榜一,空间智能与GPT-6 Astra并驾齐驱
这家中国公司,刚跑完了物理闭环里最难的一段路]
开源项目 量子位 9-14 阅读 10 · 访客 8
新豆包手机助手首发体验,智能手机正在变成「行动终端」
真正的 AI 手机,应该是「行动终端」 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 ]
大模型 爱范儿 9-14 阅读 13 · 访客 10