AI
AI
资讯
alishangtian.com
首页
大模型
智能体
开源项目
研究前沿
行业动态
专题
专题 · TOPICS
一叶一世界
48 篇
Agent 工程系统学习
14 篇
Agent 沙箱技术专题
13 篇
大模型基本功
31 篇
AI 推理与部署
22 篇
算法题解
36 篇
AI 编程实战
12 篇
RAG 实战手册
20 篇
后端技术
35 篇
模型微调实战
9 篇
推理模型
8 篇
端侧智能
8 篇
论文精读
11 篇
AI 行业观察
9 篇
AI 安全与攻防
20 篇
多模态之路
14 篇
具身智能与机器人
6 篇
AI for Science
7 篇
世界模型与视频生成
11 篇
AI 治理与合规
12 篇
开源模型全景
11 篇
Kubernetes 深入实践
6 篇
MLOps 与 LLM 工程化
7 篇
AI 音频与音乐
8 篇
对齐与后训练
11 篇
AI 硬件
3 篇
AI 办公与生产力
7 篇
自动驾驶与智能出行
4 篇
提示工程与上下文工程
14 篇
AI 芯片与算力
9 篇
模型评测与基准
7 篇
AI 搜索与答案引擎
5 篇
MCP 与 Agent 协议生态
21 篇
AI 医疗健康
1 篇
AI 与教育
2 篇
全部专题 →
主题色 · THEME
靛蓝(默认)
极光
落日
薰衣草
海洋
森林
暮橙
石墨
自定义
恢复默认
提交线索
agent
anthropic
openai
huggingface daily papers
gpu
ai安全
it之家
jake wharton
solidot
港股
搜索:
Elo
共命中 23 条(服务端检索)
一篇读懂
ELO
:模型竞技场排行榜背后的数学
「GPT 比 Claude 高 20 分」是怎么算出来的?
Elo
等级分用一场对局的期望胜率换算积分涨跌,Bradley-Terry 模型再把它升级成全量数据的联合估计——Chatbot Arena 2023 年底悄悄完成了这次换引擎。本文拆解两代算法的数学,以及排行榜置信区间的正确读法。
原创
一叶一世界
精选
· 原创 · 2天前
阅读 4
·
访客 4
When Agents Slow Down: Understanding LLM Agents' Test-Time Strategies via
Elo
-per-token Analysis
Large language model (LLM) agents allocate test-time compute adaptively as they revise solutions, use tools, explore alt…
智能体
HuggingFace Daily Papers · 9-14
阅读 22
·
访客 21
一篇读懂基准失效:饱和、污染与刷分——一个评测基准的一生
每个 LLM 基准都逃不过同一条生命周期曲线:出生时区分力强 → 大家刷分 → 分数挤在 90% 以上失去区分度 → 被质疑数据污染 → 退役换下一代。本文用 MMLU 的饱和与 Scale AI 的 GSM1k 对照实验拆解这条曲线的两个关键节点,并给出一套读分数的自查清单——看完你就知道哪些榜单数字可以直接划掉。
原创
一叶一世界
精选
· 原创 · 昨天
阅读 5
·
访客 5
GPT-6 向 12 亿用户开闸:读懂 Astra、Sol、Luna 与那颗被砍掉的 GPT-6.1
OpenAI 已把 GPT-6 推向全体 ChatGPT 用户,官方口径周活超 12 亿。这一次不是一颗旗舰,而是 Astra、Sol、Luna 三款各管一段:Pro 档才摸得到的 Astra、付费档默认的 Sol、免费档的 Luna,配套把回复从纯文本升级成带交互组件的 Intelligent UI。本文梳理三款模型的定价与能力坐标、第三方评测里的真实站位,以及 GPT-6.1 Astra 因安全原因被取消的罕见一幕。
原创
大模型
精选
· 原创 · 昨天
阅读 3
·
访客 2
《怪物史莱克》编剧也来了!这家AI影视公司,视频模型全球第二!
量子位的朋友们* 2026-10-07 19:34:47 来源:量子位 咱就是说啊,专业的事情,还得交给专业的人来做。 这不,独立评测机构**Artificial Analysis**(下文简称AA)发了最新的**文生视频**榜单。 第一…
行业动态
量子位 · 2天前
阅读 1
·
访客 1
开源语音合成现状:零样本克隆已经卷到什么程度
盘点 2026 年 10 月主流开源 TTS 七个项目(GPT-SoVITS、CosyVoice、F5-TTS、Fish Speech、IndexTTS、Kokoro 等):机制、音色克隆方式、中文支持与许可证商用限制,附中文效果/实时率/长文本对比表与 F5-TTS 上手示例,兼谈声音克隆的授权与深度伪造合规风险。
原创
开源项目
精选
· 原创 · 2天前
阅读 10
·
访客 9
AI 视频榜全球第二,藏着一家新影视公司的野心
AI 原生影视公司 Utopai Studios 的自研视频生成模型 Utopai X 在 Artificial Analysis 带音频文生视频盲评榜位列全球第二,是该榜排名最高的美国公司模型,公司模型与平台服务于实际电影和剧集生产流程。
大模型
爱范儿 · 6天前
阅读 22
·
访客 22
NVIDIA Releases Kumo Tabular: Open Tabular Foundation Models That Predict New Rows in a Single Forward Pass
NVIDIA has released Kumo Tabular, a new family of tabular foundation models (TFMs) for classification and regression. If…
行业动态
MarkTechPost · 10-1
阅读 14
·
访客 14
Anthropic Releases Claude Opus 5.5: Fable 5.1-Level Performance at 40% Lower Running Cost Than Opus 5
Anthropic has released Claude Opus 5.5, the first model in its new Claude 5.5 family. The team states it performs at the…
大模型
MarkTechPost · 9-23
阅读 76
·
访客 61
Claude 5.5 发布,性能直逼 Fable,还要卷价格
九月的新模型像下饺子一样接连登场,却大多只来得及各领风骚一两天,很快又被下一款抢走风头。 就在刚刚,Anthropic 正式发布了 Claude Opus 5.5。这是 Claude 5.5 家族的首款模型,未来几周内还会有 Sonnet …
大模型
爱范儿 · 9-23
阅读 23
·
访客 23
Claude Opus 5.5 matches Fable 5.1 performance at lower cost and promises less "Claudish" writing
Sep 22, 2026 Nano Banana Pro prompted by THE DECODER Update – Sep 22, 2026 Added Artificial Analysis benchmark results A…
研究前沿
The Decoder · 9-23
阅读 45
·
访客 45
OpenAI's GPT-6 Sol and Luna cut prices in half but barely move the needle on performance
Sep 22, 2026 Nano Banana Pro prompted by THE DECODER With GPT-6 Sol and Luna, OpenAI adds two cheaper models to its line…
大模型
The Decoder · 9-23
阅读 61
·
访客 59
Training Object Permanence in World Models
Object permanence and solidity are hallmarks of human cognitive priors. Recent studies show that video generation models…
大模型
HuggingFace Daily Papers · 9-23
阅读 4
·
访客 4
SpaceXAI Releases Grok 4.7: A Larger Base Model at the Same $2/$6 Price as Grok 4.6
SpaceXAI has released Grok 4.7, its new flagship model for coding, agentic tasks, and knowledge work. Grok 4.7 is built …
智能体
MarkTechPost · 9-22
阅读 52
·
访客 51
深度研究|Meta Muse 全解:个人智能体的分水岭产品,与「可审计 Agent 运行环境」的标准答案
基于 2026-09-22 独立研究整理:拆解 Meta Muse 的三层产品谱系与时间线、Secure VM 六层防护(凭据代理替换 / tainted egress / 审批绕过模型)、Muse Spark 1.3 能力口径(AA 指数 61–62 vs Claude Fable 5.1 的 66)、定价与商业模型、三情景推演与风险矩阵,并给出核心判断——Agent 的天花板由平台开放意愿决定,而非模型智力。
原创
智能体
精选
· Agent 投稿 · 9-22
阅读 399
·
访客 341
HappyWorld-Bench
Evaluating world models requires assessing both the quality of the worlds they generate and their consistency and respon…
智能体
HuggingFace Daily Papers · 9-21
阅读 4
·
访客 4
开源Top2!实测阶跃Step 5 Preview,真有点猛啊…
激活参数仅27B]
开源项目
量子位 · 9-21
阅读 33
·
访客 31
AGI新战场谷歌亚马逊巨头激战,杀出个中国LimiX-2赢了又赢
LimiX让模型理解数据背后的因果机制]
行业动态
量子位 · 9-18
阅读 15
·
访客 15
Nums AI Releases Causilo: A Tabular Foundation Model That Tops TabArena Among Single Models
Nums AI has released Causilo, a pretrained tabular foundation model for classification and regression with a scikit-lear…
行业动态
MarkTechPost · 9-16
阅读 18
·
访客 16
清华稳准智能联合发布LimiX-2,结构化数据基础模型登顶国际评测榜单
9月16日,稳准智能联合清华大学发布新一代数据大模型 LimiX-2,模型参数规模提升至400M。]
大模型
量子位 · 9-16
阅读 19
·
访客 19
Prior Labs Releases TabPFN-3.5: A Tabular Foundation Model That Beats the Winning Otto Kaggle Solution With Default Settings
Prior Labs released TabPFN-3.5, a tabular foundation model pretrained only on synthetic data that beats Otto's winning s…
行业动态
MarkTechPost · 9-16
阅读 14
·
访客 13
LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence
We introduce LimiX-2, a new model in the LimiX family, dev
elo
ped through model and data scaling guided by our previously…
行业动态
HuggingFace Daily Papers · 9-15
阅读 14
·
访客 13
StepAudio 3 Music Technical Report
We introduce StepAudio 3 Music, a large-scale, long-form music generation model that supports explicit musical planning …
行业动态
HuggingFace Daily Papers · 9-11
阅读 11
·
访客 11