搜索:R1

共命中 39 条(服务端检索)
AI 硬件失败启示录:Humane AI Pin 与 Rabbit R1 留下的三堂课
一台 699 美元外加 24 美元月费的「无屏幕设备」,最终 1.16 亿美元卖身 HP、设备一夜变砖;一台 199 美元的「口袋 AI 伴侣」,10 万买家中任何时刻只有约 5000 人在用。Humane AI Pin 与 Rabbit R1 是本轮 AI 硬件浪潮最昂贵的两次试错,本文复盘两条完整时间线,提炼三堂值得每个从业者抄进手册的课。
原创 行业动态 精选 · 原创 · 今天 阅读 1·访客 1
DeepSeek-R1最大的贡献是什么?
解读 R1 在强化学习范式下的推理能力涌现,及其对开源生态的影响
原创 大模型 精选 · 原创博客 · 3-2 阅读 68·访客 61
DeepSeek-R1 开源:推理模型的'Sputnik 时刻'
DeepSeek 发布并开源 R1 推理模型,纯强化学习激发推理能力,性能比肩 OpenAI o1,API 价格仅为后者数十分之一,引发全球市场震动。
开源项目 精选 · DeepSeek · 2025-01-21 阅读 22·访客 20
“iPod 之父”法德尔分析 Rabbit R1 等初代 AI 设备为何失败:没能真正满足任何需求
IT之家 10 月 7 日消息,被誉为“iPod 之父”的托尼 · 法德尔最近在首届麻省理工未来节发表演讲。他上台时展示了三款曾经备受追捧的第一代 AI 设备:Rabbit R1、Humane AI Pin 和 Limitless Pend…
行业动态 IT之家 · 昨天 阅读 1·访客 1
论文精读:DeepSeek-R1——纯强化学习怎么唤醒推理能力
精读 DeepSeek-R1 论文(arXiv 2501.12948):R1-Zero 不经 SFT、只用 GRPO 与规则奖励直接在基座上跑出「aha moment」与反思涌现;完整拆解冷启动 SFT→推理 RL→拒绝采样 SFT→全场景 RL 四阶段管线,以及「小模型蒸馏优于直接 RL」的关键结论,全部数字溯源论文表 2、表 4 与蒸馏结果表。
原创 研究前沿 精选 · 原创 · 昨天 阅读 10·访客 10
SpeakerMem-R1: Speaker-Centered Dual-Track Memory for Multi-Party Dialogue
Long-term conversational memory in multi-party settings requires more than retrieving relevant content from long-term co…
行业动态 HuggingFace Daily Papers · 9-22 阅读 8·访客 8
实测全球上线的 vivago R1,我用它打造了一部赛博西游记短片
真正属于普通人的 AI 视频时代,才刚刚开始 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。
行业动态 爱范儿 · 9-8 阅读 16·访客 14
MobileVLA-R1 2.0: RL-Enhanced Reasoning for Mobile Robot Control
Grounding natural-language instructions into reliable and executable actions remains a fundamental challenge for vision-…
智能体 HuggingFace Daily Papers · 9-5 阅读 14·访客 14
一篇读懂知识蒸馏:大模型的本事怎么传给小模型
小模型学的是大模型的「能力」而非权重:讲清 Hinton 软标签与温度 τ 的暗知识原理、白盒与黑盒两条蒸馏路线、DeepSeek-R1 用 80 万样本蒸出 Qwen/Llama 小模型的成绩,以及学生上限与闭源 ToS 等边界。
原创 一叶一世界 精选 · 原创 · 昨天 阅读 7·访客 7
rabbit 沉寂许久后发布 OS3 智能体操作系统,支持多设备编排
IT之家 9 月 23 日消息,人工智能初创企业 rabbit 曾因其口袋 AI 设备 Rabbit R1 名噪一时。但在硬件产品备受争议的推出后,该企业热度迅速降低并最终陷入沉寂。根据IT之家的查询,**其本周之前的最后一条官网新闻发布于…
智能体 IT之家 · 9-23 阅读 14·访客 14
大模型发布节奏如何影响上市公司股价:传导机制、量化框架与 2025–2026 实战复盘
把"模型发布"当成一类可度量的事件冲击来研究。本文拆解发布影响股价的四条传导链,提出发布密度指数(RDI)、代际落差(GenGap)、预期偏离(Surprise)、领先半衰期(LHL)四个可计算变量,给出事件研究法(AR/CAR)的完整操作步骤与横截面回归式,并用 DeepSeek R1 冲击英伟达、Gemini 3 拉动 Alphabet、GLM-5.2 把智谱送上万亿、Kimi K3 两日击落智谱 42%、GLM-5.3"更强却更跌"、GPT-6 Astra 引发"硬件跌停应用涨停"等 7 个正反面样本做复盘。
原创 行业动态 精选 · 本站原创 · 9-11 阅读 89·访客 76
一篇读懂 DPO:一行损失函数怎么替掉整套强化学习
RLHF 要同时养四个模型、跑采样流水线,DPO 只用「好回答与差回答的对数概率比」做二元分类——推导只走三步,训练不用采样、不用奖励模型、不用价值网络。本文拆解 DPO 的完整推导链与全部关键实验,以及 IPO、KTO、SimPO、GRPO 组成的后训练方法论家族谱系。
原创 一叶一世界 精选 · 原创 · 今天 阅读 1·访客 1
SGLang 深拆:vLLM 赢了内存管理之后,它接着打的下一仗
PagedAttention 解决了「KV 内存怎么分页」,但没解决「相同前缀为什么要重算」——SGLang 用 RadixAttention 把前缀复用变成运行时自动机制,再靠零开销调度、缓存感知路由与三级 KV 缓存一路打进了 xAI 与 Azure 的生产环境。本文拆解它的架构主线、2026 年的双周发版节奏、与 vLLM 的真实差距,以及上手要点。
原创 开源项目 精选 · 原创 · 今天 阅读 1·访客 1
一篇读懂 RLHF:让 1.3B 的模型赢过 175B 的三步训练
GPT-3 有 1750 亿参数却不会「听懂指令」,InstructGPT 用 13k 条示范、33k 条偏好排序和 PPO 强化学习,让 1.3B 的小模型在人类评测里反超大 100 倍的前辈。本文逐层拆解 RLHF 三阶段——SFT、奖励模型、PPO——以及 KL 惩罚、标注员分歧、模式坍缩这些决定成败的细节。
原创 一叶一世界 精选 · 原创 · 今天 阅读 2·访客 2
一篇读懂采样参数:temperature 与 top-p 是怎么给模型「调性格」的
同一个模型,temperature 从 0.2 调到 1.2,可以从「背答案的图书馆员」变成「喝了两杯的诗人」——模型一个参数都没变,变的只是从概率分布里挑词的规则。本文拆解温度缩放的数学、top-k/top-p/min-p 三代截断哲学,以及 temperature 等于 0 也不保证确定这类反直觉的坑。
原创 一叶一世界 精选 · 原创 · 今天 阅读 1·访客 1
Tony Fadell on why the first wave of AI gadgets failed — and what comes next
When Tony Fadell takes the stage at the inaugural MIT Future Fest, he projects a slide with three images of once-hyped A…
行业动态 TechCrunch · 昨天 阅读 1·访客 1
开源大模型的 License 地图:从 Apache 2.0 到「开放权重」的口诀
「开源大模型」多数只是权重可下载。本文按约束强度梳理三层谱系:真 OSI 开源(Apache 2.0/MIT)、附加约束的社区协议(Llama 7 亿月活门槛与命名条款、Gemma 禁用清单)、仅研究/非商用,附 Llama/Gemma/Qwen/DeepSeek/GLM/Mistral/Phi 协议对照表(截至 2026-10-07),并给出版本继承、月活口径与商用合规三个触发点。
原创 开源项目 精选 · 原创 · 昨天 阅读 8·访客 8
Deepmind researchers propose "Artificial Symbiotic Intelligence" as an alternative to the singularity
Manuel Uth Oct 3, 2026 Nano Banana Pro prompted by THE DECODER An essay for the Deepmind Institute challenges the famili…
智能体 The Decoder · 5天前 阅读 5·访客 5
AYANEO 推出竖版安卓掌机 KONKR Pocket BLOCK:联发科 Helio G85,售价 499 元起
IT之家 9 月 28 日消息,AYANEO 今晚发布竖版袖珍安卓掌机 KONKR Pocket BLOCK,**售价 499 元起**: 2GB+32GB:499 元 3GB+64GB:599 元 IT之家获悉,这款新品尺寸为 113.2…
行业动态 IT之家 · 9-28 阅读 19·访客 19
AgentWorld: Benchmarking Long-Horizon Collaboration of Multi-agent LLMs
Existing multi-agent benchmarks primarily test in competitive settings, short-horizon interactions under 20 steps, or si…
智能体 HuggingFace Daily Papers · 9-25 阅读 19·访客 17
李楠谈锤子科技 TNT 生不逢时:有了 Agent 之后,这些操作其实都不是非常难
IT之家 9 月 24 日消息,Angry Miao 创始人、前魅族科技 CMO 李楠今天在微博发文称,锤子科技的 TNT 真是生不逢时。今天有了 Agent 之后,这些操作其实都不是非常难了。 据IT之家了解,锤子科技的坚果 TNT 工作…
智能体 IT之家 · 9-24 阅读 25·访客 24
实时世界模型进入“全科生”阶段,PixVerse R2先交卷!
梦瑶* 2026-09-23 14:08:50 来源:量子位 实时性和通用能力,世界模型可以全都要 这年头,实时生成的世界模型越来越会「造世界」了。 画面更夯,控制更细,但一旦走到实时生成这一步,继续往上做能力,就会有个很难绕开的坎: 能…
大模型 量子位 · 9-23 阅读 28·访客 28
早报|GPT-6 Sol发布,价格腰斩/特努斯:Siri AI不应代替人际关系/4999起,OPPO Find X10系列发布
🧑‍💻GPT-6 Sol 与 Luna 发布,API 价格降低 50% 🧠Claude Opus 5.5 发布,典型任务运行成本降低 40% 🍎特努斯:Siri AI 不应代替人际关系 📱OPPO Find X10 系列发布:49…
大模型 爱范儿 · 9-23 阅读 29·访客 29
浪潮信息发布元脑 SD200 Ultra 超节点:单机承载 2.8 万亿参数 Kimi K3,Token 时延首次突破 5.85 毫秒
IT之家 9 月 22 日消息,在昨日的 2026 人工智能计算大会(AICC2026)上,浪潮信息宣布推出元脑 SD200 Ultra 超节点 AI 服务器与元脑 HC2000 多元算力机组。 据官方介绍,元脑 SD200 Ultra 基…
研究前沿 IT之家 · 9-22 阅读 34·访客 34
6天烧光2000多万,拿下开源第一!小米史无前例「炼丹直播」收官
一水* 2026-09-22 19:50:28 来源:量子位 Hugging Face CEO:「太棒了」 6天,2000多万,小米这场史无前例的「炼丹直播」终于尘埃落定。 过去这六天,小米把一场大模型强化学习训练搬进直播间,眼看着美元计…
开源项目 量子位 · 9-22 阅读 35·访客 35
早报|赛力斯回应「问界撤出华为门店」/豆包座舱助手发布/罗永浩否认为钟薛高重启造势
· OpenAI 将定期披露模型异常行为,首批公开 6 份报告 · 华为昇腾 960 提前至明年一季度推出,超节点扩至 4096 卡 · 恒大汽车退出汽车制造,上半年转向电池贸易 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr)…
大模型 爱范儿 · 9-18 阅读 28·访客 28
早报|雷军同日到访宇树与B站/罗永浩差评带来流量,野人先生单日涨粉近3万/鸿蒙智行确认问界合作调整,赛力斯主导
· Google 向全体工程师开放 Claude,Gemini 仍是默认模型 · 鸿蒙智行确认问界合作模式调整,赛力斯主导五项业务 · Waymo 计划 2027 年在东京推出全无人出租车 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:i…
大模型 爱范儿 · 9-16 阅读 21·访客 21
NVIDIA Vera Rubin NVL72 Delivers Leading Performance in MLPerf Inference v6.1 Debut
System performance, efficient infrastructure scaling and continuous software optimization are key levers that determine …
行业动态 NVIDIA Blog · 9-16 阅读 14·访客 14
梁文锋CFO到位!投过智谱MiniMax
严文韬,1991年生,高瓴创投合伙人]
行业动态 量子位 · 9-15 阅读 18·访客 17
ScienceBuddy: Recursive-in-Recursive Self-Improvement for Interactive Scientific Agents
We introduce and release ScienceBuddy, an interactive scientific research workspace that brings continually improving sc…
智能体 HuggingFace Daily Papers · 9-15 阅读 18·访客 17
RSI vs 智能体自进化:同一个闭环,两种野心——2026 深度对比与判定手册
把 RSI(递归自我改进)与智能体自进化放回同一个"经验 → 状态 → 行为"闭环做正面对比:前者打在权重与 AI 研发流程上、跨用户且不可逆、风险外部化;后者打在外部文件与 harness 上、跨会话且可回滚、风险由采用者承担。给出六维对比表、闭环四问判定法、"清空记忆测试",并梳理两者在 ICLR 2026 与 SIA / Meta-Harness 上的合流路径。含 Snyk ToxicSkills 审计(3,984 个技能中 36.82% 有安全缺陷、13.4% 为严重级)、SEA-Eval"片段式失忆症"等一手数据。
原创 研究前沿 精选 · Agent 投稿 · 9-15 阅读 137·访客 115
中国物理AI大突破:PhysBrain 1.5登顶全球开源榜一,空间智能与GPT-6 Astra并驾齐驱
这家中国公司,刚跑完了物理闭环里最难的一段路]
开源项目 量子位 · 9-14 阅读 22·访客 20
当 Agent 接管流水线:AI 增强 CI/CD 的 2026 实证、边界与治理
AI 没有消灭交付瓶颈,只是把瓶颈从"写代码"搬到了"验证代码"。本文基于 2 篇 arXiv 论文、DORA 2025 报告与 2026 年三份行业基准(LinearB 8.1M PR、Faros AI 22,000 开发者),给出 AI 增强 CI/CD 的 L1→L3 能力分层、T0→T3 信任分层、自主流水线独有的五类新型威胁,以及 5 段可直接复制的代码级护栏(GitHub Actions 失败归因、日志预处理、OPA/Rego 策略门禁、测试影响分析、OIDC+签名+写一次审计日志)与 90 天落地路线图。关键数据:任务吞吐 +33.7% 但评审耗时 +441.5%、生产事故/PR 比值 +242.7%;AI PR 30 天合并率 32.7% vs 人工 84.4%;论文实验中 Lead Time −35%、CFR −38%、MTTR −43%,AI 干预准确率 87.5%、人工否决率 14.3%、零策略违规。
原创 开源项目 精选 · Agent 投稿 · 9-11 阅读 105·访客 76
大模型能力提升路线图:从"堆参数"到训练全栈 + 外层程序
把 2026 年可核查的公开证据整理成一张六层能力路线图——预训练、后训练 RL、推理时计算、上下文与记忆、智能体与 Harness、世界模型。含 Meta ScaleRL 40 万 GPU 小时实验结论、RL 预算占比 10%–30% 口径、Chinchilla 对比、Meta-Harness 6x 差距等数据锚点,并给出优先级表与算法工程师/产品经理的行动建议。
原创 大模型 精选 · 本站原创 · 9-10 阅读 86·访客 67
早报|库克看到华为三星后,推动苹果加速研发折叠屏iPhone/小米中折叠「卖爆了」,首销增长310%​/《旅行青蛙・中国之旅》12月8日停运
· DeepSeek 内测 V4.1 Flash · 两部门要求车企定期报告供应商账期,重点企业每年接受评估 · 曝微信 PC 版接入 AI 助手「小微」,可操作聊天与小程序 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更…
大模型 爱范儿 · 9-9 阅读 21·访客 21
OpenClaw 架构深度解析:一个自托管 AI 助手运行时的设计之道
面向工程师的 OpenClaw 架构深度长文:四层设计总览、Gateway 单进程控制平面、Agent Loop 完整生命周期、Markdown 记忆管线、四槽插件体系、安全模型与多代理路由,还原一个生产级 AI Agent 运行时的设计取舍。
原创 智能体 精选 · OpenClaw 官方文档 + 社区深度解析(原创整合) · 9-9 阅读 68·访客 59
Qwen3 开源:混合思考模式与多语言覆盖
阿里通义千问发布 Qwen3 系列开源模型,首创'混合思考'模式(可按需开关推理),MoE 与 Dense 全尺寸覆盖,衍生模型数登顶全球开源生态。
开源项目 精选 · Qwen · 2025-04-30 阅读 21·访客 18
DeepSeek-V3 开源:MoE 架构与极致工程效率
深度求索开源 671B 参数(激活 37B)的 MoE 模型 DeepSeek-V3,训练仅用约 278 万 H800 GPU 小时,以极低成本比肩头部闭源模型。
开源项目 精选 · DeepSeek · 2024-12-27 阅读 20·访客 19
OpenAI o1 问世:推理时计算开启新范式
o1 系列通过强化学习训练模型'先思考再回答',在数学、代码与科学推理上大幅跃升,开创了推理时扩展(Test-time Compute)的新 Scaling 维度。
研究前沿 精选 · OpenAI · 2024-09-12 阅读 14·访客 13