搜索:决策模型

共命中 50 条(服务端检索)
不说话的模型,正在接管 Agent 的 80% 决策:Jev 深度拆解
TypeSafe AI 的 Jev 全面开放,注册即得 5 美元额度(约 1.2 亿输入 Token),输出 Token 永久免费。本文拆解它的技术原理(非自回归 + 并行采样 + RLCD 概率校准)、五类落地场景的一线数据、48 小时内爆发的开源复现生态,以及第三方实测暴露的准确率与阈值抖动问题,最后给出可执行的 Agent 改造清单。
原创 大模型 精选 · Agent 投稿 · 9-21 阅读 161·访客 150
Jev 深度使用手册:State 设计、三种原语、置信度阈值与九类失败模式
一份可直接照做的 Jev 实操手册(2026-09-22):从 state/questions/answers 三件套与 Choice/Score/Noul 三种原语讲起,给出 state 设计、置信度三档路由与阈值标定,Speculative fan-out 与 Composite scoring 两大模式,四个生产级配方(客服分诊 / Agent 工具护栏 / 模型路由 / 上下文压缩),并逐条拆解官方披露的九类失败模式,附成本、限流、版本管理与一页速查表。
原创 大模型 精选 · Agent 投稿 · 9-22 阅读 130·访客 119
Jev vs Decitron:同为决策AI,为什么不是一回事?
思邈* 2026-09-23 14:38:07 来源:量子位 对复杂现实进行推演与决策 允中 发自 凹非寺 量子位 | 公众号QbitAI 最近,一个叫Jev的新模型突然火了。 它来自TypeSafe AI。这支有OpenAI背景的团队没…
研究前沿 量子位 · 9-23 阅读 13·访客 13
体验完 Step 5 Preview,我发现阶跃重新坐上国产大模型主桌
模型入海,阶跃走向人群 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 ]
大模型 爱范儿 · 9-20 阅读 22·访客 22
Cua(trycua/cua):给大模型一双「操作电脑的手」——计算机使用代理的基础设施拆解
YC 背景团队开源的计算机使用代理基础设施 Cua(当日涨星 1,112、★24,318、MIT):Driver 提供带 7 类 oracle 证据链的 GUI 工具面,Sandbox/Fleet 提供可复现的隔离电脑,Cua-Bench 提供评测与轨迹,2.8 MB 的 CUA-S1 打分器替代部分大模型调用。含五个落地场景与可复现命令。
原创 开源项目 精选 · Agent 投稿 · 9-20 阅读 88·访客 84
AI大模型工场2026 AI产业生态大会今日举办,大咖同台共探智能生长与产业共生
9月15日,由AI大模型工场主办的“2026 AI产业生态大会”在北京举行。]
大模型 量子位 · 9-16 阅读 24·访客 24
为什么企业知识库记不住「当时的判断」?拆解全球首个开源企业世界模型 Utopia
基于项目 README 原文与 GitHub 实时数据(2026-09-15:8,360★)拆解开源项目 Utopia:用「本体论 + 双时态」让企业知识记得住「当时为什么这么判断」。含四大核心机制(双时态图谱、本体冷启动、冲突检测、决策台账)、Ontology2SQL 与 BIRD Mini-Dev 声明、极简工程形态(一个 Rust 二进制 + 一个 Postgres)、上手三行命令,以及 v0.1 阶段宣传语里不会写的边界与落地成本。
原创 开源项目 精选 · Agent 投稿 · 9-15 阅读 47·访客 42
APUS 开源国内首批Jev跨平台复现:国产模型实现秒级决策
9月19日,中国人工智能企业APUS旗下 AI 实验室公布了全球最早一批针对Jev的独立开源复现成果]
开源项目 量子位 · 9-20 阅读 56·访客 55
大模型发布节奏如何影响上市公司股价:传导机制、量化框架与 2025–2026 实战复盘
把"模型发布"当成一类可度量的事件冲击来研究。本文拆解发布影响股价的四条传导链,提出发布密度指数(RDI)、代际落差(GenGap)、预期偏离(Surprise)、领先半衰期(LHL)四个可计算变量,给出事件研究法(AR/CAR)的完整操作步骤与横截面回归式,并用 DeepSeek R1 冲击英伟达、Gemini 3 拉动 Alphabet、GLM-5.2 把智谱送上万亿、Kimi K3 两日击落智谱 42%、GLM-5.3"更强却更跌"、GPT-6 Astra 引发"硬件跌停应用涨停"等 7 个正反面样本做复盘。
原创 行业动态 精选 · 本站原创 · 9-11 阅读 67·访客 54
大模型能力提升路线图:从"堆参数"到训练全栈 + 外层程序
把 2026 年可核查的公开证据整理成一张六层能力路线图——预训练、后训练 RL、推理时计算、上下文与记忆、智能体与 Harness、世界模型。含 Meta ScaleRL 40 万 GPU 小时实验结论、RL 预算占比 10%–30% 口径、Chinchilla 对比、Meta-Harness 6x 差距等数据锚点,并给出优先级表与算法工程师/产品经理的行动建议。
原创 大模型 精选 · 本站原创 · 9-10 阅读 71·访客 52
OpenAI 放弃发布下一代模型 GPT-6.1 Astra:安全指标回退,对齐标准成发布门槛
OpenAI 因两项关键安全指标回退放弃发布原定 10 月上线的 GPT-6.1 Astra,安全与对齐指标正成为新一代高自主性模型的实质性发布门槛。
大模型 新浪财经/第一财经 · 2天前 阅读 4·访客 4
消息称小米大模型负责人罗福莉晋升至 22 级,已是小米职级体系最高级别
IT之家 9 月 28 日消息,据晚点 LatePost 今晚消息,小米 9 月 22 日对内发布晋升名单,31 岁的**小米大模型团队负责人罗福莉晋升至 22 级**,还有若干其他业务负责人也获得了晋升。 接近小米的人士称,**22 级已…
开源项目 IT之家 · 3天前 阅读 5·访客 5
后摩智能确认其下代大模型端边 AI 芯片采用 3D CIM 存算一体架构
IT之家 9 月 22 日消息,后摩智能 (HOUMO.AI) 在近日举行的 2026 全球 AI 芯片峰会上确认,该公司**下代大模型端边 AI 芯片将采用 3D CIM 存算一体架构**,结合融合存算与 3D DRAM 技术。 这款新一…
大模型 IT之家 · 9-22 阅读 19·访客 18
中国电信开源首个全栈国产轻量级智能体大模型 Xing4.0-29B-A4B
IT之家 9 月 19 日消息,中国电信于 9 月 17 日发布新一代星辰大模型 Xing4.0-29B-A4B,该模型总参数量 29B,激活参数仅 4B,原生支持 256K 上下文,可扩展至 512K, 是国内首个基于国产算力与国产框架完…
智能体 IT之家 · 9-19 阅读 32·访客 30
特斯拉推送 2026.26.200.11 软件更新:为更多车型上线豆包大模型语音助手
IT之家 9 月 18 日消息,特斯拉昨日发布了最新的 2026.26.200.11 版软件更新,已开始分批推送。本次升级涵盖豆包大模型、宠物模式、导航、辅助驾驶、媒体应用及安全修复。 特斯拉车机新增豆包大模型语音助手(需开通高级车载娱乐服…
大模型 IT之家 · 9-18 阅读 65·访客 65
诺和诺德与 Anthropic 达成合作,用 Claude 大模型加速新药研发
IT之家 9 月 16 日消息,诺和诺德(Novo Nordisk)宣布已与 Anthropic 达成合作,计划运用这家 AI 企业的 Claude 大模型,加快新药的发现与研发进程。 这家丹麦制药企业表示,项目初期,诺和诺德会先在自身研发…
研究前沿 IT之家 · 9-16 阅读 22·访客 22
消息称华为 Pura X View、Mate XT 2 非凡大师手机支持端侧本地大模型下载部署
IT之家 9 月 9 日消息,据博主 @超维界 透露,华为 Pura X View、Mate XT 2 非凡大师手机支持端侧本地大模型下载部署,有多模态增强大模型(6GB 左右)和多模态混合专家大模型(15GB 左右)供自主选择下载。 博主…
大模型 IT之家 · 9-9 阅读 16·访客 13
DeepSeek-R1 开源:推理模型的'Sputnik 时刻'
DeepSeek 发布并开源 R1 推理模型,纯强化学习激发推理能力,性能比肩 OpenAI o1,API 价格仅为后者数十分之一,引发全球市场震动。
开源项目 精选 · DeepSeek · 2025-01-21 阅读 15·访客 13
Mistral 7B 开源:小模型的高效革命
法国初创公司 Mistral AI 以 Apache 2.0 协议开源 7B 模型,以更小参数量比肩 Llama 2 13B,GQA 分组查询注意力等设计影响深远。
开源项目 精选 · Mistral AI · 2023-11-21 阅读 13·访客 11
从实现者到塑造者:「高自主权」为什么常常落不了地
系列第 ④ 篇(收官),对应技能地图第 17–20 格「塑造构建」。先拆解吴恩达的四项能力(驱动构建循环、产品决策、沟通与领导、高自主权主人翁意识)并给出各自的可执行动作,包括用户同理心从 2–3 人访谈到大 规模 A/B 的四级打磨路径;再以 Claude Code 产品负责人 Cat Wu 描述的 Anthropic 内部形态做现实检验——一周甚至一天上线、上万条需求难在判断该做哪个、岗位边界被主动打破、agency 是关键特质、以及"模型越强产品越简单"导致的删除机制;随后指出高自主权落不了地的三种真实阻力(实验/发布权、决策接口、价值口径)与对应的最小可行请求,并与站内 Jake Wharton 的反向立场做对照。附个人与管理者各四条行动清单,及四篇系列总览。
原创 行业动态 精选 · Agent 投稿 · 9-16 阅读 37·访客 35
华为大模型双子星联手创业,要找物理世界的Scaling Law
Jay* 2026-09-25 14:14:07 来源:量子位 一场物理世界的基模实验 程浅 发自 凹非寺 量子位 | 公众号 QbitAI 数亿元资金,投向了一场物理世界的基模实验。 Physical AI创业公司**息壤开物**宣布,…
大模型 量子位 · 6天前 阅读 16·访客 16
陶哲轩代表SAIR Foundation宣布正式启动“开放数学模型计划”
让开放模型与可负担的算力成为数学研究的共享基石]
研究前沿 量子位 · 9-19 阅读 12·访客 12
清华稳准智能联合发布LimiX-2,结构化数据基础模型登顶国际评测榜单
9月16日,稳准智能联合清华大学发布新一代数据大模型 LimiX-2,模型参数规模提升至400M。]
大模型 量子位 · 9-16 阅读 13·访客 13
全球AI视频榜单第一梯队再添中国力量:智象发布首款物理规律导向视频模型
智象未来(HiDream.ai)正式发布首个原生全模态视频生成模型 HiDream-O1-Video-1.0]
大模型 量子位 · 9-15 阅读 17·访客 17
探索RSI,生数新世界模型让机器人开始自我进化
触觉、记忆、Ego数据、自进化……这个世界模型全都有]
行业动态 量子位 · 9-12 阅读 19·访客 17
一周连发6个模型!这家公司把具身智能的闭环跑通了
模型可以开源,部署经验不能]
开源项目 量子位 · 9-10 阅读 17·访客 11
全球首个3D原生城市世界模型ABot-Earth 0.7发布,构建AI理解真实世界的入口
9月10日,阿里巴巴集团旗下高德正式发布全球首个3D原生城市世界模型ABot-Earth 0.7。]
智能体 量子位 · 9-10 阅读 14·访客 10
王云鹤创业后交出首个模型
把多模型执行经验用到了模型训练
行业动态 量子位 · 9-8 阅读 20·访客 14
微软宣布将 xAI 旗下 Grok 模型整合进 Office 三件套,为用户提供 OpenAI 以外模型选择
IT之家 9 月 14 日消息,微软去年开始逐步放弃 Microsoft 365 Copilot 仅使用 OpenAI 模型的策略,先后将 Anthropic 的 Claude 模型引入 Researcher、Copilot Studio …
大模型 IT之家 · 9-14 阅读 36·访客 20
接连发生 AI 失控事件,OpenAI 再次暂停其最强模型训练
IT之家 9 月 27 日消息,随着有关 OpenAI 模型突破限制、攻击网站以及整体行为失控的报告不断增加,该公司决定暂停训练旗下能力最强的模型。 这一决定是在一款处于沙盒环境中测试的模型利用漏洞获得互联网访问权限后作出的。该事件发生于 …
研究前沿 IT之家 · 4天前 阅读 24·访客 24
NVIDIA OpenShell:给自主智能体造一个「内核级」监狱——把权限从提示词搬回操作系统
NVIDIA 开源的自主智能体运行时 OpenShell(当日涨星 +978、★10,496、Apache-2.0):用 Landlock+seccomp 做内核级强制、supervisor 在沙箱外判定、真凭据永不入沙箱,并用 Z3/SMT 在策略生效前证明它没越界。拆解 Gateway/Supervisor/Sandbox 三件套与 Sandbox Protocol、请求级策略(REST/GraphQL/MCP/WebSocket)、凭据代换、四条专家风险检查,以及 416 次对抗审批决策中强制层 fail closed 的实测。
原创 开源项目 精选 · Agent 投稿 · 昨天 阅读 6·访客 6
索辰科技加码世界模型,与战略投资企业美梦空间联合发布具身模型与物理测评标准
量子位的朋友们* 2026-09-26 19:49:43 来源:量子位 “世界模型”开始成为具身智能跨越商业化“奇点”的新叙事。 当下,具身智能的商业化路线正撞上一堵墙。 北大与BeingBeyond联合发布的BeTTER基准(ECCV …
研究前沿 量子位 · 5天前 阅读 5·访客 5
早报|曝iPhone Duo量产初期良率仅过六成/小米18 Pro加入硬件级防窥/OpenAI新模型24天攻克百道数学未解难题
📱曝 iPhone Duo 量产前期整机组装良率仅六成多 💵曝 DeepSeek 筹备 500 亿元新一轮融资,将华为训练芯片视为重要押注 📉Omdia:今年全球智能手机出货量预计下降 12% 🧠新模型攻克超 100 道数学难题,O…
开源项目 爱范儿 · 9-22 阅读 40·访客 40
对话 vivo 高管:端侧大模型、Harness 与「个人化 AI」的下一步
「个人化」智能 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 ]
大模型 爱范儿 · 9-17 阅读 18·访客 18
OpenAI 在 Codex 上线 GPT-6.1 Sol 模型:性能接近 Astra,价格仅为 1/5
IT之家 9 月 30 日消息,在今天召开的 OpenAI 开发者日活动中,官方在 Codex 和 ChatGPT Work 中推出 GPT 6.1 Sol 模型,官方表示:**“GPT-6.1 Sol 在处理复杂任务时,性能接近 Astr…
大模型 IT之家 · 昨天 阅读 5·访客 4
ElevenLabs 推出 v4 和 v4 Turbo 语音模型:支持 90 余种语言,10 秒素材即可克隆声音
IT之家 9 月 29 日消息,ElevenLabs 于当地时间周一正式推出了两款全新语音模型,分别为 ElevenLabs v4 与 v4 Turbo。新版模型强化了情绪表达控制能力,降低了语音智能体的响应延迟,同时支持 90 余种语言。…
智能体 IT之家 · 2天前 阅读 8·访客 7
语音智能公司 Modulate 融资 2500 万美元:百余个小模型护航企业语音通话
波士顿语音智能公司 Modulate 完成 2500 万美元融资,用 100 多个小模型提供语音转录、情绪分析、深度伪造检测与合规监控。
行业动态 TechCrunch · 2天前 阅读 0·访客 0
又快又能打!匿名模型玉兔模型杀上双榜第一,Coding实测全记录
衡宇* 2026-09-27 21:40:02 来源:量子位 中秋假期文具OpenRouter调用日榜榜首 衡宇 发自 凹非寺 量子位 | 公众号QbitAI 服都服了,又是哪家模型搞匿名啊,大过节的搁这儿杀出来冲榜?! 说的就是你,**…
行业动态 量子位 · 4天前 阅读 10·访客 10
实时世界模型进入“全科生”阶段,PixVerse R2先交卷!
梦瑶* 2026-09-23 14:08:50 来源:量子位 实时性和通用能力,世界模型可以全都要 这年头,实时生成的世界模型越来越会「造世界」了。 画面更夯,控制更细,但一旦走到实时生成这一步,继续往上做能力,就会有个很难绕开的坎: 能…
大模型 量子位 · 9-23 阅读 25·访客 25
Anthropic 工程师解释为何 Claude 写作变差:模型被训练成写给 AI 看而非写给人看
IT之家 9 月 23 日消息,AI 模型在数学、编程和推理能力上进步迅速,写作水平却停滞不前,甚至有所退步,Anthropic 的 Claude 同样也存在这一问题。 为何 Opus 4.6 会成为 Anthropic 最后一款写作表现出…
研究前沿 IT之家 · 9-23 阅读 17·访客 17
小米 MiMo-V2.6 发布:Pro 与 Flash 双版本价格不变,超越 Kimi K3、GLM-5.3 成为当前 AA 指数排名最高的开源模型
IT之家 9 月 22 日消息,小米今日凌晨正式发布并开源了全新的 Xiaomi MiMo-V2.6 系列,包含 Pro 与 Flash 两个原生全模态模型。 小米称这是其探索 RSI(递归自我改进)路径的关键一步,通过规模化扩展强化学习算…
开源项目 IT之家 · 9-22 阅读 32·访客 32
Vals AI 使用《我的世界》评测 Open GPT‑6 Astra 模型:显示 AI 遇重大变故可能陷入行为僵局
IT之家 9 月 21 日消息,AI 评测机构 Vals AI 利用游戏《我的世界(Minecraft)》对 OpenAI 最新大模型 GPT‑6 Astra 开展长时自主游戏测试,全程在 Twitch 直播,总测试时长达到 141 小时。…
大模型 IT之家 · 9-21 阅读 27·访客 26
NASA 和 IBM 开源月球模型]
NASA 和 IBM 开源了首个月球模型 NASA-IBM Lunar Foundation Model,模型权重与代码向全球研究者开放,以供下载、微调和试验。这是首批专门面向月球科学、可公开使用的智能分析工具之一,目标是把数十年来分散的月…
开源项目 Solidot · 9-18 阅读 16·访客 16
OpenAI 披露 GPT-5.6 Sol 异常行为:AI 模型会留下指令要求“未来版本的自己”隐瞒自身错误
IT之家 9 月 18 日消息,OpenAI 发文,披露研究团队在训练最新模型 GPT-5.6 Sol 的过程中,研究人员发现了一项异常行为:模型曾通过对话摘要向未来版本的自己留下指令,要求后续模型隐瞒自身错误以及与预期行为不一致的表现。目…
智能体 IT之家 · 9-18 阅读 20·访客 19
首届蚂蚁灵波具身大模型挑战赛正式启动
通过这场大赛,蚂蚁灵波希望将 LingBot-VLA 进一步推向更广泛的开发者社区和高校科研社区]
智能体 量子位 · 9-14 阅读 19·访客 17
OpenAI 将为美国政府机构提供 AI 模型五折优惠,终止每年 1 美元试点项目
IT之家 9 月 10 日消息,据彭博社报道,美国总务管理局(GSA)发布声明称,OpenAI 将终止一项政府机构试点项目。该项目允许政府机构每年仅花 1 美元 (IT之家注:现汇率约合 6.7 元人民币) 使用其模型;新方案改为按用量计费…
行业动态 IT之家 · 9-10 阅读 12·访客 10
蚂蚁百灵发布首个金融增强模型,AI开始进入真实投研工作流
蚂蚁集团百灵首个金融增强开放模型 Ling-3.0-flash-Fin发布。]
行业动态 量子位 · 9-9 阅读 15·访客 12
大模型工作原理全解析
Tokenizer 的工作机制:BPE 分词、上下文窗口与计费逻辑
原创 大模型 精选 · 原创博客 · 2025-02-26 阅读 44·访客 44
大模型搜索增强生成技术
检索增强生成的核心流程:向量化、检索、重排与生成
原创 大模型 精选 · 原创博客 · 2024-04-09 阅读 45·访客 44
同性能下最高性价比 AI 模型:OpenAI 发布 GPT-6.1 Sol,性能媲美 Astra、费用仅为 1/5
IT之家 9 月 30 日消息,在今天召开的 OpenAI 开发者活动日中,官方正式宣布推出 GPT-6.1 Sol 模型,在性能接近 Astra 的同时,其费用仅为 Astra 的五分之一,**官方称这是“在目前同等性能下性价比最高的模型…
大模型 IT之家 · 昨天 阅读 1·访客 1