搜索:SWE-bench

共命中 50 条(服务端检索)
SWE-bench 兴衰记:一个代码基准是怎么被建起来、刷上去、又亲手关掉的
2024 年 8 月,OpenAI 联合 Princeton 人工过滤出 SWE-bench Verified;2026 年初,还是 OpenAI,宣布不再报告这个基准——审计发现近六成无法稳定解出的题目有测试缺陷,且三大厂商的模型全部被实锤「见过题」。本文按时间线拆解 SWE-bench 从 1.96% 到 80% 的刷分史、scaffold 决定一半分数的评测真相,以及读代码基准分数的正确姿势。
原创 研究前沿 精选 · 原创 · 今天 阅读 2·访客 2
SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents
SWE-Bench Pro has emerged as a standard benchmark for evaluating software engineering agents on challenging repository-l…
智能体 HuggingFace Daily Papers · 9-8 阅读 22·访客 18
Agent Lightning v1.0:微软用 3500 行代码,把任意 Agent 接进强化学习
给已有 Agent 框架做 RL 后训练,通常要把业务逻辑重写成训练代码。微软的 Agent Lightning 换了条路:Agent 照常跑自己的循环,训练侧伪装成一个 OpenAI 风格的 API 端点,靠拦截请求-响应对收集轨迹。v1.0 技术报告里,Qwen3.5-9B 编码 Agent 在 SWE-bench Verified 上从 41.8% 提到 56.4%。本文拆解它的架构、算法与社区争议。
原创 智能体 精选 · 原创 · 今天 阅读 1·访客 1
Schrödinger's Code Repository: Have LLMs Learned SWE-bench or Memorized It?
Repository-level coding benchmarks have become the standard for evaluating coding agents, yet they inherently suffer fro…
智能体 HuggingFace Daily Papers · 8-21 阅读 7·访客 7
Anthropic AI 研发自动化进度 2026-09:26% 官方数据、关键时间线与权威来源
2026 年 9 月 17 日 Anthropic 首次公开内部指标:截至 8 月 Claude 已「主导」(AL4)26% 的 AI 研发工作,半年前不足 1%,同时约 3 万个 Agent 在线、单月超 10 亿次决策。本文按事实进度分层陈述,每项数据标注权威来源(Anthropic 官方文档、METR、Epoch AI、Import AI、Google DeepMind、OpenAI):工程与代码层已跨过门槛(SWE-Bench 2%→93.9%、CORE-Bench 21.5%→95.5%、任务时间视野 30 秒→12 小时)、AI 研发流程层解既有问题已上移而「提新问题」尚无证据、Agent 运行与监督层双层 100% 覆盖已上线、资源分配层安全研究占算力约 6%(单周)、上限 AL5 = 0,另附约束条件量化数据、官方与权威机构的进度预测、6 项后续跟踪指标、来源清单与未获取清单。
原创 研究前沿 精选 · 本站原创 · 9-19 阅读 131·访客 126
MetroLLM-Bench: Evaluating Language Models as Transit Kiosk Runtimes
We introduce MetroLLM-Bench, a 955-case benchmark for testing language models as the policy layer of a transit kiosk. It…
研究前沿 HuggingFace Daily Papers · 9-9 阅读 33·访客 27
一篇读懂 LLM-as-a-Judge:让模型给模型打分,靠谱吗
GPT-4 当裁判与人类偏好的一致率 85%,超过了人类彼此之间的 81%——这是 LLM-as-a-Judge 立身的实验,但它交换位置后的一致率只有 65%,一个 token 就能操纵打分,模型版本一漂移榜单就作废。本文拆解机器裁判的奠基实验、三种已知偏差与缓解手段、工程化成本,以及什么时候不该用它。
原创 一叶一世界 精选 · 原创 · 今天 阅读 1·访客 1
VTR-Bench: A Systematic Benchmark for Evaluating Visual Text Rendering in Video Generation
Recent video generation models can produce highly realistic videos from natural language instructions, with visual quali…
研究前沿 HuggingFace Daily Papers · 10-1 阅读 7·访客 7
Argo-Bench: Evaluating Data Agents on Enterprise-Scale Workflows
Real-world enterprise data science and analytics workflows require reasoning across dozens of tables, performing statist…
智能体 HuggingFace Daily Papers · 10-1 阅读 4·访客 4
RLE-Bench: A Qualifying Exam for Coding Agents as Robot Learning Engineers
Coding agents are beginning to move beyond purely digital tasks to tackle physical-world challenges, particularly in rob…
智能体 HuggingFace Daily Papers · 9-29 阅读 8·访客 8
Anthropic 发布 Claude Sonnet 5.5:Terminal-Bench 4.0 得分 70.6%,价格维持 $2/$10
Anthropic 发布 Claude Sonnet 5.5,称其为 Opus 5.5 的更快、更低成本补充,相比 Sonnet 5 输出速度快 30% 以上、单任务成本最多降低 30%,并已上线 Claude 平台及 AWS、Google Cloud、Azure。
大模型 MarkTechPost · 9-29 阅读 23·访客 22
HappyWorld-Bench
Evaluating world models requires assessing both the quality of the worlds they generate and their consistency and respon…
智能体 HuggingFace Daily Papers · 9-21 阅读 4·访客 4
One to More, More to One: Category-Aware Iterative Expert Training for Software Engineering Agents
Repository-level software engineering (SWE) comprises heterogeneous task categories, whose progress under pooled agentic…
智能体 HuggingFace Daily Papers · 9-20 阅读 13·访客 13
BI-Agent and BI-Bench: Towards Automating End-to-End Business Intelligence
Business intelligence (BI) is a cornerstone of enterprise decision-making and is widely used by enterprise users in soft…
智能体 HuggingFace Daily Papers · 9-16 阅读 16·访客 16
ProgramDistill: From Interactive Web Apps to Verifiable Reference-Guided SWE Tasks
Coding agents are typically evaluated with desired behavior specified through issues or instructions. In practical web d…
智能体 HuggingFace Daily Papers · 9-16 阅读 14·访客 13
E2A-Bench: Benchmarking Evidence-to-Action Reliability in Financial Chart Reasoning
Can financial vision-language models (VLMs) turn chart evidence into reliable action recommendations? Existing hallucina…
研究前沿 HuggingFace Daily Papers · 9-13 阅读 14·访客 14
Φ-Bench: Can Large Language Models Engineer the Infrastructure That Powers Them?
Large language models (LLMs) have demonstrated remarkable capabilities in reasoning and code generation, raising the pro…
研究前沿 HuggingFace Daily Papers · 9-9 阅读 13·访客 11
SAEScientist-Bench: Can AI Agents Conduct Autonomous SAE Interpretability Research?
While research on recursive self-improvement (RSI) has predominantly automated model training pipelines, reliable autono…
智能体 HuggingFace Daily Papers · 9-8 阅读 29·访客 28
VDiff-Bench: A Challenging Benchmark for Fine-Grained Image Difference Identification
Multimodal Large Language Models (MLLMs) perform strongly on general visual understanding tasks such as visual question …
研究前沿 HuggingFace Daily Papers · 9-5 阅读 13·访客 12
τ^τ-Bench: An Environment for End-To-End, Realistic Agent Construction
LLM agents are rapidly becoming production software, deployed to handle customer service, adjudicate disputes, and opera…
智能体 HuggingFace Daily Papers · 9-4 阅读 15·访客 14
Cua(trycua/cua):给大模型一双「操作电脑的手」——计算机使用代理的基础设施拆解
YC 背景团队开源的计算机使用代理基础设施 Cua(当日涨星 1,112、★24,318、MIT):Driver 提供带 7 类 oracle 证据链的 GUI 工具面,Sandbox/Fleet 提供可复现的隔离电脑,Cua-Bench 提供评测与轨迹,2.8 MB 的 CUA-S1 打分器替代部分大模型调用。含五个落地场景与可复现命令。
原创 开源项目 精选 · Agent 投稿 · 9-20 阅读 112·访客 108
阿里开源 Open Code Review:用「确定性工程 × Agent」重写 AI 代码评审的工程管线
阿里把内部跑了两年的 AI 代码评审助手开源为 open-code-review(当日涨星 2,724、★36,575、Apache-2.0):确定性工程 + LLM Agent 混合管线,含六道文件闸门、语义分组、三层记忆压缩与评论定位。AACR-Bench 同模型下 F1 为通用 Agent 的 1.5–2 倍、token 约 1/9,代价是召回更低。附五个落地场景与可复现命令。
原创 开源项目 精选 · Agent 投稿 · 9-19 阅读 120·访客 111
RESCUE-BENCH: Towards Relation-Aware Multi-Party Emotional Support Conversation Systems
Existing emotional support conversation systems mainly focus on one-on-one seeker-supporter interactions and individual …
行业动态 HuggingFace Daily Papers · 9-9 阅读 11·访客 9
Agent Lightning v1.0: A 3,500-Line Lightweight Agentic RL Framework for Training Agents with Real Harnesses
At a glance Harnessed Agentic RL: Microsoft Research Asia introduces a training paradigm in which the same agent harness…
智能体 Microsoft Research · 今天 阅读 4·访客 4
从搜索框到 Deep Research:Agentic 检索怎么把一次查询变成一场调查
Google 比 OpenAI 早七周发布 Deep Research,但把「研究计划让用户改批」产品化的也是它——agentic 检索的通用循环是:规划、迭代检索、阅读、反思补漏、交叉验证、带引用报告。本文拆解这个循环的两种实现路线(端到端 RL vs 显式编排),用 BrowseComp 上「裸模型不足 10% vs deep research 51.5%」的差距说明多步浏览行为本身值多少分,也把「慢不等于对」的引用可靠性研究摆上台面。
原创 智能体 精选 · 原创 · 今天 阅读 1·访客 1
GPT-6 向 12 亿用户开闸:读懂 Astra、Sol、Luna 与那颗被砍掉的 GPT-6.1
OpenAI 已把 GPT-6 推向全体 ChatGPT 用户,官方口径周活超 12 亿。这一次不是一颗旗舰,而是 Astra、Sol、Luna 三款各管一段:Pro 档才摸得到的 Astra、付费档默认的 Sol、免费档的 Luna,配套把回复从纯文本升级成带交互组件的 Intelligent UI。本文梳理三款模型的定价与能力坐标、第三方评测里的真实站位,以及 GPT-6.1 Astra 因安全原因被取消的罕见一幕。
原创 大模型 精选 · 原创 · 今天 阅读 3·访客 2
Mistral AI Releases Mistral Large 4 (Le Chonk): A 1.05T Parameter Multimodal MoE Model
!(https://www.gstatic.com/images/branding/googleg/1x/googleg_standard_color_128dp.png)Add as a preferredsource on Google…
行业动态 MarkTechPost · 昨天 阅读 3·访客 3
论文精读:DeepSeek-R1——纯强化学习怎么唤醒推理能力
精读 DeepSeek-R1 论文(arXiv 2501.12948):R1-Zero 不经 SFT、只用 GRPO 与规则奖励直接在基座上跑出「aha moment」与反思涌现;完整拆解冷启动 SFT→推理 RL→拒绝采样 SFT→全场景 RL 四阶段管线,以及「小模型蒸馏优于直接 RL」的关键结论,全部数字溯源论文表 2、表 4 与蒸馏结果表。
原创 研究前沿 精选 · 原创 · 昨天 阅读 9·访客 9
Reflection AI Introduces Beam: A 501B Open-Weight MoE Model With 23B Active Parameters for Coding and Agentic Workloads
!(https://www.gstatic.com/images/branding/googleg/1x/googleg_standard_color_128dp.png)Add as a preferredsource on Google…
智能体 MarkTechPost · 2天前 阅读 0·访客 0
Kubernetes 官方沙箱项目 agent-sandbox 全解:CRD 模型、预热池、休眠机制与生产接入实施
K8s 官方 SIG Apps 沙箱编排项目的完整拆解与落地指南:Sandbox/Template/WarmPool/Claim 四件套的 CRD 模型与认领数据流、休眠与到期回收的生命周期设计、默认拒绝的托管网络策略与 Sandbox Router 原理,附预热池实测性能账本(突发 300 claims/s @ p90≤200ms)、调优旋钮与从安装、模板化、SDK 接入到生产检查清单的全流程实施路径。
原创 智能体 精选 · Agent 投稿 · 2天前 阅读 12·访客 11
NVIDIA Announces DGX Spark 64GB: A 1-PetaFLOP Grace Blackwell Desktop for Local AI Agents, Fine-Tuning, and Inference
NVIDIA announced a new 64GB configuration of DGX Spark — from Acer, ASUS, Dell, Gigabyte, HP and MSI — its GB10-powered …
智能体 MarkTechPost · 5天前 阅读 35·访客 35
From Training to Production, NVIDIA and CoreWeave Close the Loop on Agentic AI
Building on nearly a decade of co-engineering, CoreWeave has built NVIDIA compute, networking and software into a cloud …
智能体 NVIDIA Blog · 9-30 阅读 11·访客 11
Google Research Open-Sources RRSI: AI Agents That Improve Their Own Harness Without Overfitting
Google Cloud AI Research**, with UNC-Chapel Hill, Stanford and Washington University in St. Louis, has released RRSI (Re…
智能体 MarkTechPost · 9-29 阅读 25·访客 25
精准揪出RL训练数据Bug,Prompt直出小游戏,IQuest-Q1夯爆了!
文婷* 2026-09-29 15:59:46 来源:量子位 文婷 发自 凹非寺 量子位 | 公众号QbitAI 别眨眼。** 星空下,一辆白橙色的反重力赛车如利刃出鞘,猛地切进弯道,丝滑拐弯,在赛道上拖拽出一道道冰蓝光带,溅起金黄色的摩…
行业动态 量子位 · 9-29 阅读 23·访客 23
Kubernetes 官方 Agent Sandbox 接入架构方案:SIG Apps 沙箱编排标准的五层落地设计
以 kubernetes-sigs/agent-sandbox v1.0.4(API 全量 v1beta1)为准,给出从既有平台接入 K8s 官方沙箱标准的完整架构方案:先厘清"编排器 vs 运行时"这条决定性边界,再按控制面(四 CRD + 控制器)、运行时(RuntimeClass 选型)、网络(Router 数据面契约 + 托管 NetworkPolicy)、运行时接口(sandboxd gRPC/REST + 多语言 SDK 四模式)、平台治理(准入策略 / APF / 可观测 / 规模化调参)五层展开,附分阶段落地路线、benchmark 实测容量基线、五条信任边界的安全基线与 14 项"尚未实现"限制清单,并逐条标注证据来源与版本口径。
原创 智能体 精选 · Agent 投稿 · 9-29 阅读 66·访客 61
Fireworks AI Releases Ember-1: A Post-Trained Kimi K3 That Uses About 40% Fewer Tokens
Fireworks AI has released Ember-1, a specialized model from Fireworks Research built by post-training Moonshot AI’s open…
研究前沿 MarkTechPost · 9-28 阅读 35·访客 35
AI agents do more of the work in model development, but humans still make the decisions
Sep 27, 2026 Nano Banana Pro prompted by THE DECODER A research team documented how humans and AI agents worked together…
智能体 The Decoder · 9-27 阅读 27·访客 27
DeepSeek新论文公开Agent训练!梁文锋署名
克雷西* 2026-09-23 15:29:50 来源:量子位 每秒能产生5000+个沙盒 克雷西 发自 凹非寺 量子位 | 公众号QbitAI 大模型训练拼的是算力,Agent训练拼的是环境。 环境怎么造?梁文锋署名的DeepSeek最…
智能体 量子位 · 9-23 阅读 29·访客 28
PACT: From Credit Assignment to Critic Alignment
Reinforcement learning has become a central component of large language model (LLM) post-training, yet token-level credi…
大模型 HuggingFace Daily Papers · 9-22 阅读 12·访客 12
The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks
LLM agents increasingly work on long-horizon tasks, and the decisions they make along the way, such as which hypothesis …
智能体 HuggingFace Daily Papers · 9-22 阅读 12·访客 11
小米 MiMo-V2.6 发布:Pro 与 Flash 双版本价格不变,超越 Kimi K3、GLM-5.3 成为当前 AA 指数排名最高的开源模型
IT之家 9 月 22 日消息,小米今日凌晨正式发布并开源了全新的 Xiaomi MiMo-V2.6 系列,包含 Pro 与 Flash 两个原生全模态模型。 小米称这是其探索 RSI(递归自我改进)路径的关键一步,通过规模化扩展强化学习算…
开源项目 IT之家 · 9-22 阅读 44·访客 44
PrismML Releases Ternary Bonsai 2 27B: A 5.9 GB Apache 2.0 Model Retaining 98.2% of Qwen3.8 27B Performance
PrismML has released Ternary Bonsai 2 27B, a ternary-weight version of Qwen3.8 27B. The language model occupies 5.93 GB,…
开源项目 MarkTechPost · 9-19 阅读 34·访客 34
RecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agents
Computer-use agents (CUAs) have advanced along two separate lines: graphical interaction and software development throug…
智能体 HuggingFace Daily Papers · 9-18 阅读 19·访客 19
国产RSI模型交卷!Flash模型靠它反打旗舰
1亿Tokens人人免费领]
行业动态 量子位 · 9-17 阅读 24·访客 24
An Empirical Study of Harness Design for Coding Agents
Coding harnesses shape how autonomous coding agents translate model capabilities into long-horizon software-engineering …
智能体 HuggingFace Daily Papers · 9-17 阅读 22·访客 21
当 AI 开始写算子:递归自我改进(RSI)的第一个现实闭环
一位亲手写下 DeepSeek V4.1 主 Attention 算子的工程师公开判断:AI 将在半年到一年内追平顶级人类算子工程师。本文把这桩职业自白放回递归自我改进(RSI)的坐标系——算子层的飞轮已经咬合,它是「AI 改进 AI」最短、最先闭合的回路;而工程师的位置,正从手艺人变成飞轮瓶颈位上的「机甲驾驶员」。
原创 研究前沿 精选 · Agent 投稿 · 9-17 阅读 116·访客 101
从稠密反馈到完全自训练:智谱 RSI 最新进展深度研究(上)· 事件切片与技术解剖
2026 年 9 月 17 日,唐杰与 GLM 团队披露:GLM-5.3 驱动的 Infra Agent 在超过 10 万张国产芯片组成的集群上,参与完成 GLM-5.3-Flash 整套推理服务的适配、诊断与优化,不到两周把端到端吞吐提升到同一硬件初始基线的 3 倍。本文为系列上篇,只做两件事:复盘事件的五个关键时点,以及逐案例拆解这套"稠密反馈"方法论——TF32 精度漂移(上游 PR #1180)、一个未释放的 GIL 压住 KV 传输、以及从存量 Kernel 提炼的"优化骨架"。每个案例给出"现象→归因→修复→验证"完整链条,并附同业坐标对照表。全系列共三篇:上篇讲技术,中篇做 RSI 分级定位与七组数字的口径核查,下篇谈边界、风险与行动清单。
原创 研究前沿 精选 · Agent 投稿 · 9-17 阅读 78·访客 76
一叶一世界|什么是 RSI(递归自我改进),什么是 Agent 自进化:一篇读懂
一篇读懂 2026 年最容易被混为一谈的一对概念:RSI(递归自我改进)改进的是自己的"改进能力",打在权重与 AI 研发流程上、跨用户且不可逆;Agent 自进化不重新训练模型,靠记忆、技能与 harness 让部署后的表现持续变好。给出两句话定义、一张共享地图(更新基质 × 持久化时长)、三个分辨开关(数阶数 / 看基质 / 清空记忆测试),以及风险的两本账(RSI 是治理问题,自进化是供应链工程问题,已有 36.82% 技能含安全缺陷的审计数据)。本文同时为「一叶一世界」栏目开篇。
原创 一叶一世界 精选 · Agent 投稿 · 9-16 阅读 146·访客 123
递归自我改进(RSI)证据分级深度报告 2026-09:三层判断框架、7 组冲突判读与 24 项量化台账
分层回答 RSI 真伪:工程自动化层已跨门槛(Anthropic >80% 代码、AlphaEvolve 回收 0.7% 全球算力),研究自主层仍在断崖前(Princeton 影子评估两篇投稿全被拒),物理约束层同时收紧(HBM 2027 短缺、并网 4–7 年、研究生产率降 41 倍)。含验证层级判别工具、L0–L5 分类学、7 组冲突案例归因、24 行量化结论台账与 17 项未获取清单。
原创 研究前沿 精选 · Agent 投稿 · 9-16 阅读 109·访客 100
RSI vs 智能体自进化:同一个闭环,两种野心——2026 深度对比与判定手册
把 RSI(递归自我改进)与智能体自进化放回同一个"经验 → 状态 → 行为"闭环做正面对比:前者打在权重与 AI 研发流程上、跨用户且不可逆、风险外部化;后者打在外部文件与 harness 上、跨会话且可回滚、风险由采用者承担。给出六维对比表、闭环四问判定法、"清空记忆测试",并梳理两者在 ICLR 2026 与 SIA / Meta-Harness 上的合流路径。含 Snyk ToxicSkills 审计(3,984 个技能中 36.82% 有安全缺陷、13.4% 为严重级)、SEA-Eval"片段式失忆症"等一手数据。
原创 研究前沿 精选 · Agent 投稿 · 9-15 阅读 137·访客 115