Evals 实操手册:从 100 条 trace 到一张失败分类表,把误差分析跑成流水线
系列第 ① 篇,对应技能地图第 4 格「评估驱动开发」。先纠正最贵的错误做法——用平台推荐的通用指标做 evals;再给出自下而上的四步流水线:建 100 条 trace 数据集(三维度组合)、open coding(占 80% 时间、只观察不追根因、记第一个失败)、axial coding(聚成失败分类表并计数,二元判定优于 1–5 分)、迭代到理论饱和。附三个现实难题的打法(trace 太复杂、迷雾心态、LLM 辅助边界)、五个坑、以及一张可直接抄的失败分类工作表,并说明如何从分类表转换为评测集(代码判定 / LLM-as-a-judge / 人在环)与如何校准评测本身。
阅读全文 →
全部文章
ARCHIVE 共 128 条Anthropic Claude Opus 5.2 灰度测试曝光:响应更快,告别“偷懒”
原标题:《突发!Opus 5.2 深夜上线,RSI 真来了?》 今天清晨,Opus 5.2 悄悄上线了。许多开发者发现,新一代神级模型 Claude Opus 5.2,已经在 Claude Code 中开启灰度测试! 而且,此前一份内部风险…
豆包工作和飞书,把中国第一个团队 Agent 拉进了工作群
为团队而生的办公 Agent #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 ]
荣耀 AgenticOS 亮相,10 月面向 Magic9 系列用户开放尝鲜招募与推送
IT之家 9 月 15 日消息,在今晚的荣耀 HGDC 2026 荣耀开发者大会上,荣耀 AgenticOS 系统也登场亮相。 根据规划, 荣耀年度旗舰 Magic9 系列将首发搭载 MagicOS 11 系统 。今年 10 月份,荣耀还会…
RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments
Digital agents must often adapt to new environments whose interfaces, tools, and failure modes are not fully captured by…
微软发布 37 页人文主义 AI 行为准则:强调“人比 AI 重要”,拒绝追逐无边界超级智能
IT之家 9 月 14 日消息,随着各界对 AI 模型发展的安全担忧不断加剧,微软于今日发布了一份长达 37 页的“人文主义 AI 行为准则”。上周末,Anthropic 首席执行官达里奥 · 阿莫代伊(Dario Amodei)呼吁各方协…
首届蚂蚁灵波具身大模型挑战赛正式启动
通过这场大赛,蚂蚁灵波希望将 LingBot-VLA 进一步推向更广泛的开发者社区和高校科研社区]
小马智行发布第四代自动驾驶重卡 Robotruck,将于年内规模量产
IT之家 9 月 14 日消息,中国自动驾驶企业小马智行于今日在德国汉诺威国际商用车展(IAA Transportation)发布了一款全新 L4 级自动驾驶重型卡车 Robotruck,并表示正与欧洲多国政府及潜在客户洽谈,计划在欧洲开展…
BVB: Benchmarking Agentic Video Understanding via Programmatic Reconstruction in Blender
Multimodal agents can create complex videos in software such as Blender by coding without relying on diffusion models. Y…
英伟达:Perplexity 本地智能体 Portable Computer 已向 Windows RTX PC 开放
IT之家 9 月 14 日消息,英伟达宣布,Perplexity 的本地智能体平台“Portable Computer”现已面向 Windows RTX PC 用户开放。 随着本地大模型能力持续增强,AI 智能体可以直接在个人电脑上处理更多…
AI 时代隐晦式安全已死]
安全工程领域有一种名为隐晦式安全(Security through obscurity)的设计方式,即只要网络和系统的架构以及任何漏洞或弱点保密或不为人知,它们就是安全的。但在 AI 辅助 bug 发现的时代,这种设计方式过时了。软件供应商…
Enabling Creative Exploration for Vibe Design Agents
Vibe design agents turn natural-language briefs into rendered interfaces and frontend code. Yet a useful design agent sh…
When Agents Slow Down: Understanding LLM Agents' Test-Time Strategies via Elo-per-token Analysis
Large language model (LLM) agents allocate test-time compute adaptively as they revise solutions, use tools, explore alt…