AI
AI
资讯
alishangtian.com
首页
大模型
智能体
开源项目
研究前沿
行业动态
专题
专题 · TOPICS
一叶一世界
28 篇
Agent 工程系统学习
14 篇
Agent 沙箱技术专题
13 篇
大模型基本功
24 篇
AI 推理与部署
17 篇
算法题解
32 篇
AI 编程实战
12 篇
RAG 实战手册
17 篇
后端技术
34 篇
模型微调实战
9 篇
推理模型
8 篇
端侧智能
7 篇
论文精读
11 篇
AI 行业观察
8 篇
AI 安全与攻防
18 篇
多模态之路
14 篇
具身智能与机器人
5 篇
AI for Science
7 篇
世界模型与视频生成
10 篇
AI 治理与合规
6 篇
开源模型全景
10 篇
Kubernetes 深入实践
6 篇
MLOps 与 LLM 工程化
4 篇
AI 音频与音乐
8 篇
全部专题 →
主题色 · THEME
靛蓝(默认)
极光
落日
薰衣草
海洋
森林
暮橙
石墨
自定义
恢复默认
提交线索
agent
anthropic
openai
huggingface daily papers
ai安全
jake wharton
it之家
solidot
gpu
港股
搜索:
PagedAttention
共命中 9 条(服务端检索)
vLLM 与
PagedAttention
:把 GPU 显存当操作系统内存管
多请求并发时 KV Cache 的预留式分配让 GPU 显存大量空转、吞吐卡死。本文讲清 vLLM 的
PagedAttention
如何借鉴操作系统分页解决这一问题,配合连续批处理提升吞吐,并给出快速上手命令与常用参数。
原创
开源项目
精选
· 原创 · 2天前
阅读 3
·
访客 3
Open WebUI + Ollama:半小时搭好私有 LLM 工作台
Ollama 负责本地推理,Open WebUI 负责多模型对话、知识库与账号——本文在 Apple M4 上实测 Docker 组合部署全流程:官方命令、RAG 默认参数、OpenAI 兼容 API 的正确开关(v0.11 已改名),以及端口冲突、代理假 IP 导致拉模型失败等真实踩坑清单。
原创
开源项目
精选
· 原创 · 昨天
阅读 5
·
访客 5
开源模型全景 2026:六大家版本与许可证对照,什么场景该选谁
2026 年开放权重阵营的旗手已换成 GLM-5(744B,MIT)、Qwen3.5-397B-A17B(Apache 2.0)、DeepSeek V3.2(MIT)、Kimi K2 系与 Llama 4。本文按许可证、架构与部署成本三条线做全景对照,给出自托管、微调、企业集成三类场景的选型建议。
原创
大模型
精选
· 原创 · 昨天
阅读 2
·
访客 2
一篇读懂 FlashAttention:注意力为什么能又快又省显存
标准注意力的瓶颈不在算力而在显存读写:O(N²) 的注意力矩阵要在 HBM 里反复进出。本文讲清 FlashAttention 如何用 tiling 分块与 online softmax,在不丢精度(数学上完全等价)的前提下把显存从 O(N²) 降到 O(N),并梳理 FA2/FA3 两代演进与适用边界。
原创
一叶一世界
精选
· 原创 · 昨天
阅读 3
·
访客 3
手撕 Multi-Head Attention:纯 Python 从零实现并跑通
用 numpy 从零实现 Multi-Head Attention 前向(含 causal mask),45 行核心代码;附逐步形状账与参数量核算,三个实测断言验证因果依赖、softmax 归一与参数量,全部本地跑通。
原创
大模型
精选
· 原创 · 昨天
阅读 6
·
访客 5
SGLang 上手:RadixAttention 与 vLLM 之外的推理引擎选择
RadixAttention 用前缀树跨请求复用 KV Cache,是 SGLang 的招牌。本文讲机制差异,给 OpenAI 兼容服务上手命令与结构化输出、多 LoRA、投机解码现状,并对照 vLLM/Ollama 谈选型。
原创
开源项目
精选
· 原创 · 昨天
阅读 3
·
访客 3
一篇读懂 KV Cache:大模型推理加速的第一课
大模型逐 token 生成,注意力却要看全部历史,KV Cache 正是为此存在的第一级优化。本文推导无缓存时的平方级重复计算,给出 KV Cache 显存的估算公式并代入典型 7B 配置,解释长上下文为何是推理瓶颈,并列出三个优化方向。
原创
一叶一世界
精选
· 原创 · 2天前
阅读 6
·
访客 6
Ollama 实战指南:笔记本上跑大模型的正确姿势
想在笔记本上跑大模型,Ollama 是门槛最低的路径之一。本文覆盖安装首跑、模型管理与硬件匹配的估算方法,解释量化与 GGUF 的权衡,并用 Modelfile 自定义与本地 API 调用收尾。
原创
开源项目
精选
· 原创 · 2天前
阅读 7
·
访客 6
谷歌TPU跑Kimi比英伟达GPU快57%!用的还是DeepSeek推理框架
听雨* 2026-09-26 15:12:05 来源:量子位 vLLM人马创业公司团队出品 克雷西 发自 凹非寺 量子位 | 公众号QbitAI 16块谷歌TPU v7跑Kimi K3,每秒跑出了709个Token,比老黄的GB200快了…
研究前沿
量子位 · 9-26
阅读 27
·
访客 27