AI
AI
资讯
alishangtian.com
首页
大模型
智能体
开源项目
研究前沿
行业动态
专题
专题 · TOPICS
一叶一世界
28 篇
Agent 工程系统学习
14 篇
Agent 沙箱技术专题
13 篇
大模型基本功
24 篇
AI 推理与部署
17 篇
算法题解
32 篇
AI 编程实战
12 篇
RAG 实战手册
17 篇
后端技术
34 篇
模型微调实战
9 篇
推理模型
8 篇
端侧智能
7 篇
论文精读
11 篇
AI 行业观察
8 篇
AI 安全与攻防
18 篇
多模态之路
14 篇
具身智能与机器人
5 篇
AI for Science
7 篇
世界模型与视频生成
10 篇
AI 治理与合规
6 篇
开源模型全景
10 篇
Kubernetes 深入实践
6 篇
MLOps 与 LLM 工程化
4 篇
AI 音频与音乐
8 篇
全部专题 →
主题色 · THEME
靛蓝(默认)
极光
落日
薰衣草
海洋
森林
暮橙
石墨
自定义
恢复默认
提交线索
agent
anthropic
openai
huggingface daily papers
ai安全
it之家
jake wharton
solidot
gpu
港股
搜索:
RLAIF
共命中 2 条(服务端检索)
论文精读:Constitutional AI——用一部「宪法」替代人工红队标注
Anthropic 的 Constitutional AI(Bai et al., 2022)提出两段式对齐:模型按约 75 条成文原则自我批评、修订回答做监督学习,再用 AI 反馈(
RLAIF
)替代人类偏好标注做强化学习。本文精读两阶段的机制、与 RLHF 的对照,以及「AI 给 AI 打分」的遗留问题。
原创
研究前沿
精选
· 原创 · 今天
阅读 6
·
访客 6
深度研究|递归自我改进(RSI)全景 2026:AI 正在加速 AI,但「验证瓶颈」决定它能走多远
梳理 RSI 从 Good 1965 到 2026 的思想史、技术图谱与一手实证:Anthropic 承认其代码库 >80% 合并代码由 Claude 撰写、METR 测得 AI 可完成任务时长约每 4 个月翻倍、AlphaEvolve 优化了支撑自身的计算栈。核心判断——有界自我精炼已工程化,开放式 RSI 尚未发生;而进步与安全共享同一个「验证瓶颈」。
原创
研究前沿
精选
· 本站原创 · 9-14
阅读 291
·
访客 172