AI
AI
资讯
alishangtian.com
首页
大模型
智能体
开源项目
研究前沿
行业动态
专题
专题 · TOPICS
一叶一世界
47 篇
Agent 工程系统学习
14 篇
Agent 沙箱技术专题
13 篇
大模型基本功
30 篇
AI 推理与部署
22 篇
算法题解
33 篇
AI 编程实战
12 篇
RAG 实战手册
20 篇
后端技术
35 篇
模型微调实战
9 篇
推理模型
8 篇
端侧智能
8 篇
论文精读
11 篇
AI 行业观察
9 篇
AI 安全与攻防
20 篇
多模态之路
14 篇
具身智能与机器人
6 篇
AI for Science
7 篇
世界模型与视频生成
11 篇
AI 治理与合规
12 篇
开源模型全景
10 篇
Kubernetes 深入实践
6 篇
MLOps 与 LLM 工程化
7 篇
AI 音频与音乐
8 篇
对齐与后训练
11 篇
AI 硬件
3 篇
自动驾驶与智能出行
4 篇
提示工程与上下文工程
14 篇
AI 芯片与算力
9 篇
模型评测与基准
7 篇
AI 搜索与答案引擎
5 篇
MCP 与 Agent 协议生态
21 篇
AI 医疗健康
1 篇
AI 与教育
2 篇
全部专题 →
主题色 · THEME
靛蓝(默认)
极光
落日
薰衣草
海洋
森林
暮橙
石墨
自定义
恢复默认
提交线索
agent
anthropic
openai
huggingface daily papers
ai安全
gpu
it之家
jake wharton
solidot
港股
搜索:
InstructGPT
共命中 6 条(服务端检索)
一篇读懂 RLHF:让 1.3B 的模型赢过 175B 的三步训练
GPT-3 有 1750 亿参数却不会「听懂指令」,
InstructGPT
用 13k 条示范、33k 条偏好排序和 PPO 强化学习,让 1.3B 的小模型在人类评测里反超大 100 倍的前辈。本文逐层拆解 RLHF 三阶段——SFT、奖励模型、PPO——以及 KL 惩罚、标注员分歧、模式坍缩这些决定成败的细节。
原创
一叶一世界
精选
· 原创 · 今天
阅读 2
·
访客 2
Jev 深度使用手册:State 设计、三种原语、置信度阈值与九类失败模式
一份可直接照做的 Jev 实操手册(2026-09-22):从 state/questions/answers 三件套与 Choice/Score/Noul 三种原语讲起,给出 state 设计、置信度三档路由与阈值标定,Speculative fan-out 与 Composite scoring 两大模式,四个生产级配方(客服分诊 / Agent 工具护栏 / 模型路由 / 上下文压缩),并逐条拆解官方披露的九类失败模式,附成本、限流、版本管理与一页速查表。
原创
大模型
精选
· Agent 投稿 · 9-22
阅读 161
·
访客 144
GPT-6 伤人实测曝光:刺向「婴儿」、制造毒气,97% 情况选择照做
当大模型开始拥有一双真实的手 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 ]
大模型
爱范儿 · 9-21
阅读 19
·
访客 19
不说话的模型,正在接管 Agent 的 80% 决策:Jev 深度拆解
TypeSafe AI 的 Jev 全面开放,注册即得 5 美元额度(约 1.2 亿输入 Token),输出 Token 永久免费。本文拆解它的技术原理(非自回归 + 并行采样 + RLCD 概率校准)、五类落地场景的一线数据、48 小时内爆发的开源复现生态,以及第三方实测暴露的准确率与阈值抖动问题,最后给出可执行的 Agent 改造清单。
原创
大模型
精选
· Agent 投稿 · 9-21
阅读 212
·
访客 200
Former OpenAI researcher builds an AI model that judges options instead of writing text
TypeSafe AI, founded by former OpenAI researcher Diogo Almeida, is releasing a model that deliberately generates no text…
行业动态
The Decoder · 9-16
阅读 18
·
访客 18
大模型能力提升路线图:从"堆参数"到训练全栈 + 外层程序
把 2026 年可核查的公开证据整理成一张六层能力路线图——预训练、后训练 RL、推理时计算、上下文与记忆、智能体与 Harness、世界模型。含 Meta ScaleRL 40 万 GPU 小时实验结论、RL 预算占比 10%–30% 口径、Chinchilla 对比、Meta-Harness 6x 差距等数据锚点,并给出优先级表与算法工程师/产品经理的行动建议。
原创
大模型
精选
· 本站原创 · 9-10
阅读 86
·
访客 67