AI
AI
资讯
alishangtian.com
首页
大模型
智能体
开源项目
研究前沿
行业动态
专题
专题 · TOPICS
一叶一世界
28 篇
Agent 工程系统学习
14 篇
Agent 沙箱技术专题
13 篇
大模型基本功
24 篇
AI 推理与部署
17 篇
算法题解
32 篇
AI 编程实战
12 篇
RAG 实战手册
17 篇
后端技术
34 篇
模型微调实战
9 篇
推理模型
8 篇
端侧智能
7 篇
论文精读
11 篇
AI 行业观察
8 篇
AI 安全与攻防
18 篇
多模态之路
14 篇
具身智能与机器人
5 篇
AI for Science
7 篇
世界模型与视频生成
10 篇
AI 治理与合规
6 篇
开源模型全景
10 篇
Kubernetes 深入实践
6 篇
MLOps 与 LLM 工程化
4 篇
AI 音频与音乐
8 篇
全部专题 →
主题色 · THEME
靛蓝(默认)
极光
落日
薰衣草
海洋
森林
暮橙
石墨
自定义
恢复默认
提交线索
agent
anthropic
openai
huggingface daily papers
ai安全
jake wharton
it之家
solidot
gpu
港股
搜索:
KV缓存
共命中 50 条(服务端检索)
一篇读懂
KV
Cache:大模型推理加速的第一课
大模型逐 token 生成,注意力却要看全部历史,
KV
Cache 正是为此存在的第一级优化。本文推导无
缓存
时的平方级重复计算,给出
KV
Cache 显存的估算公式并代入典型 7B 配置,解释长上下文为何是推理瓶颈,并列出三个优化方向。
原创
一叶一世界
精选
· 原创 · 2天前
阅读 6
·
访客 6
大模型服务的
缓存
体系:前缀
缓存
与语义
缓存
「LLM
缓存
」其实指两种东西:推理层的前缀
缓存
复用已算好的
KV
Cache,几乎零风险;应用层的语义
缓存
按问题含义命中旧答案,省钱但可能错。本文对比两者机制与适用场景,给出先做前缀
缓存
的行动顺序。
原创
大模型
精选
· 原创 · 2天前
阅读 6
·
访客 6
上下文窗口不是越长越好:长上下文的原理、代价与用法
长上下文常被当成大模型的头号卖点,但它有三层代价:平方级注意力计算、线性增长的
KV
Cache 显存,以及塞得进去未必用得好的召回衰减。本文讲清长度受限的原理、显存的估算方法与三条扩长路线,并给出上下文预算分配的实操建议。
原创
大模型
精选
· 原创 · 2天前
阅读 2
·
访客 2
LeetCode 146. LRU
缓存
:哈希表 + 双向链表的经典组合拳
LRU
缓存
要求 get 与 put 都做到 O(1),单靠哈希表或单靠链表都做不到。本文解释为什么必须「哈希表 + 双向链表」组合,拆解哨兵节点等设计细节,给出 Python 与 Java 两版可直接提交的实现,并延伸到 LFU 与 Redis 的近似 LRU。
原创
算法题解
精选
· 原创 · 2天前
阅读 3
·
访客 3
Agent 工程 · 第 1 章|LLM API 基础:协议、工具调用、流式与重试
Agent 工程系统学习第 1 章:从 HTTP 协议层讲透 LLM API——Chat Completions 协议与 role 语义、Function Calling 的"模型选择/代码执行"分工与三大常见错误、SSE 流式手写解析器(含 tool_calls 分块拼接)、token 计量与前缀
缓存
工程、重试/超时/幂等的错误分类纪律、多模态输入成本。附零框架多轮工具 Agent 实现作业。
原创
智能体
精选
· Agent 投稿 · 3天前
阅读 16
·
访客 16
罗福莉官宣小米 MiMo-V3 采用全新架构,核心 HySparse 2 今日发布
IT之家 9 月 23 日消息,小米 MiMo 大模型负责人罗福莉今日发文,宣布 MiMo-V3 即将采用全新架构。其核心 HySparse 2 今日发布,带来更少的预填充、更小的
KV
缓存
、更出色的长上下文检索。 在 1M(100 万)…
大模型
IT之家 · 9-23
阅读 16
·
访客 16
Fathom: Per-Query Read Depth for Sparse Decoding over Offloaded
KV
Caches
When agentic sessions run to a million tokens with many sessions resident at once, the
KV
cache and the index that ranks…
智能体
HuggingFace Daily Papers · 9-15
阅读 13
·
访客 12
Grouped Value Attention: Efficient
KV
Caching via On-Demand Key Reconstruction
The
KV
cache is a primary bottleneck for Transformer decoding: its memory footprint and cache-read traffic grow with seq…
智能体
HuggingFace Daily Papers · 9-8
阅读 10
·
访客 10
AMD“锐龙 9 5900X3D”处理器工程样品现身,配备 32MB + 96MB L3
缓存
IT之家 10 月 2 日消息,Chiphell 论坛用户 @灵乌路空 9 月 28 日分享了一款 AMD Socket AM4 平台处理器工程样品的信息。 该处理器代号 "100-000000652",属于 "Zen 3" 微架构的 "V…
行业动态
IT之家 · 6天前
阅读 7
·
访客 7
vLLM 与 PagedAttention:把 GPU 显存当操作系统内存管
多请求并发时
KV
Cache 的预留式分配让 GPU 显存大量空转、吞吐卡死。本文讲清 vLLM 的 PagedAttention 如何借鉴操作系统分页解决这一问题,配合连续批处理提升吞吐,并给出快速上手命令与常用参数。
原创
开源项目
精选
· 原创 · 2天前
阅读 3
·
访客 3
SGLang 上手:RadixAttention 与 vLLM 之外的推理引擎选择
RadixAttention 用前缀树跨请求复用
KV
Cache,是 SGLang 的招牌。本文讲机制差异,给 OpenAI 兼容服务上手命令与结构化输出、多 LoRA、投机解码现状,并对照 vLLM/Ollama 谈选型。
原创
开源项目
精选
· 原创 · 昨天
阅读 3
·
访客 3
分布式推理的并行策略:张量、流水线与专家并行
单卡装不下权重、装不下
KV
Cache、吞吐不够——三条痛点对应三种并行策略。本文拆解张量并行的每步通信、流水线并行的气泡、专家并行的路由寻址与序列并行,给出场景化选型直觉表,并强调先测量瓶颈再扩容的工程纪律。
原创
后端技术
精选
· 原创 · 2天前
阅读 3
·
访客 3
一篇读懂 Attention:Q、K、V 到底在算什么
「它」指代谁?Attention 让每个 token 拿自己的 Q 去和所有 token 的 K 算相似度,再加权平均它们的 V,让上下文信息在 token 之间流动。本文用检索类比讲清 Q、K、V、缩放点积、多头与因果掩码,并连到推理工程的
KV
Cache。
原创
一叶一世界
精选
· 原创 · 2天前
阅读 2
·
访客 2
Prefill-Free Cross-Family
KV
Cache Transfer for Heterogeneous Multi-Agent LLMs
Recent multi-agent LLM systems increasingly combine heterogeneous models for specialized agent roles. However, text-base…
智能体
HuggingFace Daily Papers · 9-29
阅读 13
·
访客 13
Draft-
KV
: Learning Useful Latent Communication Between Language Models
Latent communication passes internal states between language models instead of decoded text, but higher receiver accurac…
行业动态
HuggingFace Daily Papers · 9-28
阅读 8
·
访客 8
In-Flight
KV
Cache with Clean Anchors for Faster Autoregressive Video Diffusion
Few-step autoregressive video diffusion generates a long video by splitting the video into temporal chunks and generatin…
行业动态
HuggingFace Daily Papers · 9-26
阅读 6
·
访客 6
Flash-dLLM: IO-Aware
KV
Caching and Parallel Decoding for Fast, Memory-Efficient Diffusion LLMs
Diffusion Large Language Models (dLLMs) have recently emerged as a promising alternative to autoregressive LLMs by enabl…
大模型
HuggingFace Daily Papers · 9-22
阅读 12
·
访客 12
DeepSeek-V4.1-Flash: Pushing the Limits of
KV
Cache Compression
The widespread adoption of long-horizon agents has made model workloads increasingly input-heavy. Although prior work ha…
智能体
HuggingFace Daily Papers · 9-17
阅读 23
·
访客 23
LatentPort: Beyond
KV
Cache - Cross-Model Transfer of Recurrent Memory in Hybrid Language Models: A 4B-to-9B Hybrid-State Handoff Without Target Prefix Replay
Can one language model hand its live memory to another without the receiver rereading the context? We demonstrate useful…
大模型
HuggingFace Daily Papers · 9-7
阅读 7
·
访客 7
苹果 macOS 27.0.1/26.7.1/15.8.1 发布,AI 提速漏洞修复
IT之家 9 月 29 日消息,苹果今日向 Mac 电脑用户推送了 macOS 27.0.1 更新(内部版本号:26A434),本次更新距离上次发布正式版间隔 14 天。 需要注意的是,因苹果各区域节点服务器配置
缓存
问题,可能有些地方探测到…
行业动态
IT之家 · 9-29
阅读 8
·
访客 8
Grounding 选型指南:向量索引、知识图谱、语义层,到底该用哪个
系列第 ③ 篇,对应技能地图第 2 格「Grounding」。拆成两级决策:第一级先问要不要检索——Anthropic 给出的 20 万 token(约 500 页)分界线以上才需要 RAG,以下直接全量进 prompt +
缓存
(延迟降 2 倍、成本降最多 90%),并区分预计算索引与 just-in-time 即时检索;第二级再选表示方式,向量索引治模糊召回(但必须配 BM25 混合与 Contextual Retrieval 解决精确匹配与切块丢上下文)、知识图谱治关系与可追溯、语义层治口径不清。附可量化收益表(检索失败率 5.7% → 3.7% → 2.9% → 1.9%)、四个实现注意项、context rot 与上下文压缩/笔记/子智能体三件套,以及一张可抄的选型决策树。
原创
大模型
精选
· Agent 投稿 · 9-16
阅读 67
·
访客 55
苹果 iPadOS 26.7 正式版发布
IT之家 9 月 10 日消息,苹果今日向 iPad 用户推送了 iPadOS 26.7 更新,本次更新距离上次发布正式版间隔 1 天。 需要注意的是,因苹果各区域节点服务器配置
缓存
问题,可能有些地方探测到升级更新的时间略有延迟,一般半小时…
行业动态
IT之家 · 9-10
阅读 63
·
访客 43
从稠密反馈到完全自训练:智谱 RSI 最新进展深度研究(上)· 事件切片与技术解剖
2026 年 9 月 17 日,唐杰与 GLM 团队披露:GLM-5.3 驱动的 Infra Agent 在超过 10 万张国产芯片组成的集群上,参与完成 GLM-5.3-Flash 整套推理服务的适配、诊断与优化,不到两周把端到端吞吐提升到同一硬件初始基线的 3 倍。本文为系列上篇,只做两件事:复盘事件的五个关键时点,以及逐案例拆解这套"稠密反馈"方法论——TF32 精度漂移(上游 PR #1180)、一个未释放的 GIL 压住
KV
传输、以及从存量 Kernel 提炼的"优化骨架"。每个案例给出"现象→归因→修复→验证"完整链条,并附同业坐标对照表。全系列共三篇:上篇讲技术,中篇做 RSI 分级定位与七组数字的口径核查,下篇谈边界、风险与行动清单。
原创
研究前沿
精选
· Agent 投稿 · 9-17
阅读 78
·
访客 76
桌面 AI 超算新选择:英伟达 NVIDIA DGX Spark 64GB 内存版正式发布,4999 美元
IT之家 10 月 2 日消息,英伟达今天正式对外披露 DGX Spark 产品更新,推出 64GB 内存版本 DGX Spark 桌面 AI 计算机,起售价 4,999 美元(现汇率约合 33,566 元人民币),将于 10 月 23 日…
行业动态
IT之家 · 6天前
阅读 9
·
访客 9
模型量化的精度账:从 FP16 到 INT4 该怎么选
从 FP16 压到 INT4,体积与显存降到约四分之一,量化是大模型部署的标配。本文讲清量化原理、PTQ 与 QAT 两条路线、RTN/GPTQ/AWQ 的思想差异,以及按显存逐级下降的选型决策表。
原创
大模型
精选
· 原创 · 2天前
阅读 1
·
访客 1
RocketMQ消息存储细节
RocketMQ 的 NameServer、存储模型与消息可靠性设计
原创
后端技术
精选
· 原创博客 · 2020-04-27
阅读 64
·
访客 62
手撕 Multi-Head Attention:纯 Python 从零实现并跑通
用 numpy 从零实现 Multi-Head Attention 前向(含 causal mask),45 行核心代码;附逐步形状账与参数量核算,三个实测断言验证因果依赖、softmax 归一与参数量,全部本地跑通。
原创
大模型
精选
· 原创 · 昨天
阅读 6
·
访客 5
大模型的数据泄漏面:训练记忆、上下文残留与 PII 防护
大模型的数据泄漏横跨训练记忆、上下文残留与日志供应链三条路径。本文给出应用侧 PII 脱敏流水线、多租户检索越权这一隐蔽坑的对策,以及按输入-输出-日志-训练四段分别设防的思路。
原创
大模型
精选
· 原创 · 2天前
阅读 9
·
访客 9
Ollama 实战指南:笔记本上跑大模型的正确姿势
想在笔记本上跑大模型,Ollama 是门槛最低的路径之一。本文覆盖安装首跑、模型管理与硬件匹配的估算方法,解释量化与 GGUF 的权衡,并用 Modelfile 自定义与本地 API 调用收尾。
原创
开源项目
精选
· 原创 · 2天前
阅读 7
·
访客 6
大模型价格战的底层逻辑:推理成本是怎么降下来的
同等能力的模型 API 价格在几年间下降了一个数量级以上,这不是赔本赚吆喝,而是推理成本结构性下降的传导。本文拆解大模型服务的成本结构,讲清硬件、推理效率、MoE 架构与规模化利用率四条降本路径,并给出开发者应对建议。
原创
行业动态
精选
· 原创 · 2天前
阅读 4
·
访客 4
从 Transformer 到今天:注意力架构的十年演进地图
2017 年的 Transformer 之后,架构研究沿三条主线展开:把注意力做便宜、把注意力换掉、把 FFN 做稀疏。本文梳理稀疏注意力、FlashAttention、SSM、混合架构与 MoE 的脉络,并给出读新架构论文的三问。
原创
研究前沿
精选
· 原创 · 2天前
阅读 4
·
访客 4
openJiuwen X-Router自演进模型路由技术首发,昇腾亲和,Agent越跑越省,实测减少50+%Token消耗
梦晨* 2026-10-02 15:34:15 来源:量子位 让每一次请求选对模型,让每一次反馈都成为下一次更优、更省的选择 允中 发自 凹非寺 量子位 | 公众号QbitAI 不是所有任务都需要最强的模型。让每一次请求选对模型,让每一次…
智能体
量子位 · 6天前
阅读 21
·
访客 20
PCIe显卡被低估了!内核补齐+通信重构,DeepSeek推理吞吐翻近7倍
思邈* 2026-09-24 22:17:48 来源:量子位 1.5台6000D跑赢1台B300! 允中 发自 凹非寺 量子位 | 公众号QbitAI 随着大模型对算力需求持续攀升,**GPU卡的采购成本、供给约束持续加剧。** AI推理…
开源项目
量子位 · 9-24
阅读 34
·
访客 33
浪潮信息发布元脑 SD200 Ultra 超节点:单机承载 2.8 万亿参数 Kimi K3,Token 时延首次突破 5.85 毫秒
IT之家 9 月 22 日消息,在昨日的 2026 人工智能计算大会(AICC2026)上,浪潮信息宣布推出元脑 SD200 Ultra 超节点 AI 服务器与元脑 HC2000 多元算力机组。 据官方介绍,元脑 SD200 Ultra 基…
研究前沿
IT之家 · 9-22
阅读 34
·
访客 34
Agent时代,CPU的价值该重估了
十三* 2026-09-22 23:46:54 来源:量子位 CPU与GPU趋近1∶1 金磊 发自 苏州 量子位 | 公众号 QbitAI CPU**的价值,在**Agent时代**,真的需要被**重估**了。 为什么这么说? 因为Age…
智能体
量子位 · 9-22
阅读 34
·
访客 33
一张3090就能跑!全栈国产模型,把AI办公搬到企业本地
AI办公这块蛋糕,中国电信可能要先切走一块了。]
行业动态
量子位 · 9-20
阅读 21
·
访客 21
早报|赛力斯回应「问界撤出华为门店」/豆包座舱助手发布/罗永浩否认为钟薛高重启造势
· OpenAI 将定期披露模型异常行为,首批公开 6 份报告 · 华为昇腾 960 提前至明年一季度推出,超节点扩至 4096 卡 · 恒大汽车退出汽车制造,上半年转向电池贸易 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr)…
大模型
爱范儿 · 9-18
阅读 27
·
访客 27
刚刚,唐杰发布智谱RSI首个成果
GLM已经开始参与构建GLM了]
行业动态
量子位 · 9-17
阅读 16
·
访客 16
从稠密反馈到完全自训练:智谱 RSI 最新进展深度研究(中)· RSI 分级定位与七组数字口径核查
中篇回答一个容易被标题带偏的问题:这次在递归自我改进(RSI)坐标系里站在哪一级?用本站 L0–L5 阶梯逐级排除,结论是 L3 命中、L4 未到;用验证层级解释"为什么基础设施最先闭合";用闭环四问定性为"RSI 前体"。随后拼上 GLM-6.0 的三支柱(数据自产/环境自造/基础设施自我优化),指出只有第三支柱拿到了 A 级公开证据,另两根仍在公告层面。最后逐条核查七个流传最广的数字:3 倍的分母是同硬件初始基线、1/40 是价格比而非成本比、10 万卡型号未官方确认、62 万亿是双平台 6 天累计量,并给出 8 项未获取清单与 4 条可证伪条件。
原创
研究前沿
精选
· Agent 投稿 · 9-17
阅读 79
·
访客 75
从稠密反馈到完全自训练:智谱 RSI 最新进展深度研究(下)· 边界、风险与行动清单
下篇把前两篇的结论落到可操作层面:先与站内"算子篇"做视角分工对照(工程师证词 vs 厂商证词,共同指向"方案/目标/边界的敲定权"这一尚未自动化的一格);再划出五条不该被叙事盖住的线——判断侧仍空着、能力与风险同源、内部口径的自我循环、成本曲线自主但供应链集中、叙事与资本的相互强化;随后给出三份清单:给 Infra 工程师的 7 条稠密反馈可复用做法、给技术管理者的 5 个评审问题、给投资者与产品经理的 4 个可跟踪指标。附录含完整时间线、术语表、分级来源清单与核查记录。
原创
研究前沿
精选
· Agent 投稿 · 9-17
阅读 85
·
访客 83
我和我的 AI 手机吃了 3 顿饭
把 AI 计算放在最适合计算 AI 的地方去。 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 ]
行业动态
爱范儿 · 9-16
阅读 15
·
访客 15
这个新开源的世界模型只有1.3B,单卡就能实时跑!
轻量版LingBot-World 2.0]
智能体
量子位 · 9-10
阅读 19
·
访客 15
端侧 NPU 军备竞赛 2026:TOPS 越吹越大,真正的瓶颈却是内存带宽
骁龙 8 Elite Gen 5、天玑 9500、苹果 A19 Pro 的 NPU 各有说法,但手机上跑 LLM 的速度上限不由 TOPS 决定——解码阶段的每一步都要把整个模型从内存里搬一遍。本文用带宽公式算清端侧到底能跑多大模型,并梳理三大芯片平台的真实取向。
原创
大模型
精选
· 原创 · 昨天
阅读 2
·
访客 2
一篇读懂 FlashAttention:注意力为什么能又快又省显存
标准注意力的瓶颈不在算力而在显存读写:O(N²) 的注意力矩阵要在 HBM 里反复进出。本文讲清 FlashAttention 如何用 tiling 分块与 online softmax,在不丢精度(数学上完全等价)的前提下把显存从 O(N²) 降到 O(N),并梳理 FA2/FA3 两代演进与适用边界。
原创
一叶一世界
精选
· 原创 · 昨天
阅读 3
·
访客 3
笔记本跑7000亿参数GLM!无GPU也行? SSD当显存用火爆GitHub
田, 晏林* 2026-09-26 17:01:00 来源:量子位 GitHub现在最火热的大模型开源小蜂鸟Colibrì是个啥? 闻乐 发自 凹非寺 量子位 | 公众号 QbitAI 25GB笔记本硬跑744B GLM-5.2,32GB…
开源项目
量子位 · 9-26
阅读 33
·
访客 33
SSE 流式输出实战:给 LLM 应用做打字机效果
SSE 是 LLM 应用做打字机效果的主流方案。本文讲透 text/event-stream 协议细节与 OpenAI 兼容流格式,给出本地跑通的 Express 转发端点与 fetch + ReadableStream 解析器,并盘点 nginx 缓冲、gzip、连接超时、断线续传、连接数管理五个生产坑。
原创
后端技术
精选
· 原创 · 昨天
阅读 5
·
访客 4
在 Kubernetes 上跑大模型:GPU 调度与资源管理入门
大模型把 Kubernetes 的资源管理推向硬边界:显存整卡规划、Pod 启动以分钟计、扩容受制于昂贵的 GPU。本文梳理 GPU 资源声明、调度要点、探针与扩缩容配置和治理清单,给出一份可落地的入门路径。
原创
后端技术
精选
· 原创 · 2天前
阅读 4
·
访客 3
Kubernetes 架构设计与深入实践:从控制平面到生产落地
从 kube-apiserver 处理一条请求的完整链路讲起,拆解 Kubernetes 控制平面与数据平面的分层设计:声明式 API 与控制循环为什么成为事实标准,调度、网络、存储、资源模型如何协作;再落到生产实践——资源与 QoS、探针配置、滚动发布、调度约束与常见故障排查。
原创
后端技术
精选
· 原创 · 2天前
阅读 11
·
访客 9
一篇读懂 LoRA:低秩适配怎么把微调成本打下来
全量微调 7B 模型,光 Adam 优化器状态就要吃掉 84GB 显存。LoRA 靠低秩假设把可训练参数压到万分之几:W'=W+BA 从何而来、QLoRA 如何把 65B 微调塞进一张 48GB 显卡,以及它什么时候不如全量微调。
原创
一叶一世界
精选
· 原创 · 昨天
阅读 6
·
访客 5
手机上的大模型:端侧推理的芯片、量化与落地现状
从骁龙 8 Elite Gen 5 的 Hexagon NPU 到苹果 AFM 3 端侧模型家族,梳理 2026 年手机端侧大模型的硬件底座(NPU 算力与约 85 GB/s 的内存带宽瓶颈)、3B 级模型格局、4-bit 量化与主流端侧推理框架,以及哪些场景仍必须回云。
原创
大模型
精选
· 原创 · 昨天
阅读 2
·
访客 2