搜索:内存带宽

共命中 50 条(服务端检索)
端侧 NPU 军备竞赛 2026:TOPS 越吹越大,真正的瓶颈却是内存带宽
骁龙 8 Elite Gen 5、天玑 9500、苹果 A19 Pro 的 NPU 各有说法,但手机上跑 LLM 的速度上限不由 TOPS 决定——解码阶段的每一步都要把整个模型从内存里搬一遍。本文用带宽公式算清端侧到底能跑多大模型,并梳理三大芯片平台的真实取向。
原创 大模型 精选 · 原创 · 2天前 阅读 6·访客 6
一篇读懂 HBM:AI 算力的「内存墙」是怎么被摞高的
看 GPU 规格表,带宽那行数字比 FLOPS 更能决定大模型推理的快慢——HBM 用「立体堆叠 + 超宽接口」两个动作,把内存带宽做到了同代 DDR 的十几倍。本文拆解 HBM 的原理、四代演进、良率与封装的难点,以及它为什么既是 AI 芯片的标配,又是整条产业链最紧的瓶颈。
原创 一叶一世界 精选 · 原创 · 昨天 阅读 4·访客 4
一篇读懂投机解码:大模型推理的「先猜后验」
解码阶段的大模型是内存带宽问题:一次前向读完几十 GB 权重,却只产出一个 token。投机解码让小模型先猜几个、大模型一次前向并行验证,修正拒绝采样保证输出分布完全不变——2 到 6.5 倍加速的「免费午餐」。本文拆解它的数学、三代草稿方案与 2026 年的工程现状。
原创 一叶一世界 精选 · 原创 · 昨天 阅读 7·访客 7
手机上的大模型:端侧推理的芯片、量化与落地现状
从骁龙 8 Elite Gen 5 的 Hexagon NPU 到苹果 AFM 3 端侧模型家族,梳理 2026 年手机端侧大模型的硬件底座(NPU 算力与约 85 GB/s 的内存带宽瓶颈)、3B 级模型格局、4-bit 量化与主流端侧推理框架,以及哪些场景仍必须回云。
原创 大模型 精选 · 原创 · 2天前 阅读 16·访客 16
一篇读懂布隆过滤器:用 1% 的误判换 90% 的内存
「这个元素我见过吗?」——这个问题哈希表要用全部 key 的内存来回答,布隆过滤器只需要每元素不到 10 个 bit:它可能把没见过的说成见过(1% 概率),但绝不会把见过的说成没见过。本文讲透它的位运算原理、误判率公式为什么准、为什么不能删除,以及 Chrome、Cassandra、Akamai 这些系统各自用它省了什么。
原创 一叶一世界 精选 · 原创 · 昨天 阅读 0·访客 0
微软 Surface Laptop Ultra 售价公布:起价 21988 元,128GB 内存顶配售 48388 元
IT之家 10 月 8 日消息,微软中国商城今天(10 月 8 日)上架 Surface Laptop Ultra,**共有亮铂金和夜幕色两种颜色,起售价为 21,988 元,128GB 内存顶配售价为 48,388 元。** 官方介绍如下…
行业动态 IT之家 · 昨天 阅读 6·访客 6
SGLang 深拆:vLLM 赢了内存管理之后,它接着打的下一仗
PagedAttention 解决了「KV 内存怎么分页」,但没解决「相同前缀为什么要重算」——SGLang 用 RadixAttention 把前缀复用变成运行时自动机制,再靠零开销调度、缓存感知路由与三级 KV 缓存一路打进了 xAI 与 Azure 的生产环境。本文拆解它的架构主线、2026 年的双周发版节奏、与 vLLM 的真实差距,以及上手要点。
原创 开源项目 精选 · 原创 · 昨天 阅读 1·访客 1
传三星电子 12Hi HBM4E 内存已通过英伟达等主要客户质量验证测试
IT之家 10 月 7 日消息,《韩国经济日报》当地时间今日报道称,三星电子存储器业务的 12 层堆叠 HBM4E 内存已于 9 月末通过 NVIDIA(英伟达)和主要超大规模数据中心企业的质量验证测试,**各客户的供货量、合同规模、出货时…
行业动态 IT之家 · 2天前 阅读 1·访客 1
内存涨价倒逼系统瘦身:微软详解 Win11 为何要降低 RAM 占用
IT之家 10 月 5 日消息,随着内存成本持续上涨,微软正将“降低 Windows 11 内存占用”列为 2026 年剩余时间的重要工作之一。 微软 Windows 与设备业务负责人帕万 · 达武卢里(Pavan Davuluri)在官方…
行业动态 IT之家 · 4天前 阅读 22·访客 20
马斯克改口:特斯拉 AI5 芯片内存由 72GB 上调至 96GB
马斯克表示特斯拉 AI5 芯片不再采用 72GB LPDDR5 内存,而是改用 96GB 内存,此前因内存供货紧张曾削减内存规格,AI5 芯片已完成流片,将用于自动驾驶与 Optimus 人形机器人业务。
行业动态 IT之家 · 5天前 阅读 3·访客 3
桌面 AI 超算新选择:英伟达 NVIDIA DGX Spark 64GB 内存版正式发布,4999 美元
IT之家 10 月 2 日消息,英伟达今天正式对外披露 DGX Spark 产品更新,推出 64GB 内存版本 DGX Spark 桌面 AI 计算机,起售价 4,999 美元(现汇率约合 33,566 元人民币),将于 10 月 23 日…
行业动态 IT之家 · 10-2 阅读 11·访客 11
苹果 iPad 12 爆料:A19 芯片、8GB 内存、自研 N1/C1X 芯片
IT之家 9 月 26 日消息,科技媒体 MacRumors 昨日(9 月 25 日)发布博文,报道称其撰稿人 Aaron Perris 通过挖掘苹果公司代码,**发现 iPad 12 将配备 A19 芯片、8GB 内存、N1 网络芯片和 …
行业动态 IT之家 · 9-26 阅读 22·访客 22
苹果 iPhone 18 Pro 系列手机配备 12GB 内存与上一代相同,起价上涨 1000 元
IT之家 9 月 10 日消息,苹果 iPhone 18 Pro 系列手机今日正式发布,官方没有提到新机的内存容量,不过据 MacRumors 今日报道,在最新版本的 Xcode 27 中,苹果已透露了这一信息。 iPhone 18 Pro…
行业动态 IT之家 · 9-10 阅读 35·访客 25
澜起科技成功量产 DDR5 9200MT/s 客户端时钟驱动器 (CKD) 芯片
澜起科技宣布其 CK01P 客户端时钟驱动器量产,支持 9200 MT/s 数据传输速率,面向 DDR5 CUDIMM 等下一代客户端内存模组。
行业动态 IT之家 · 9-29 阅读 14·访客 14
vLLM 与 PagedAttention:把 GPU 显存当操作系统内存管
多请求并发时 KV Cache 的预留式分配让 GPU 显存大量空转、吞吐卡死。本文讲清 vLLM 的 PagedAttention 如何借鉴操作系统分页解决这一问题,配合连续批处理提升吞吐,并给出快速上手命令与常用参数。
原创 开源项目 精选 · 原创 · 3天前 阅读 5·访客 5
英伟达发布 DGX Station for Windows:本地运行 1 万亿参数 AI 模型,最高 748GB 内存
IT之家 10 月 8 日消息,太平洋时间 10 月 7 日上午 10 点(北京时间 10 月 8 日凌晨 1 点)在美国旧金山举办的发布会上,英伟达发布 DGX Station for Windows,**定位为桌面级 AI 超级计算机,…
研究前沿 IT之家 · 昨天 阅读 1·访客 1
一篇读懂 CoWoS:卡住 AI 芯片出货脖子的,不是制程是封装
NVIDIA 新卡发布的节奏,很多时候不是被 4nm 产线决定的,而是被台积电一项叫 CoWoS 的 2.5D 封装产能决定的——它把 GPU 裸片和 HBM 并排装进同一个封装。本文拆解 CoWoS 解决什么问题(光刻棚格极限与「内存要贴着算力放」)、S/R/L 三个变体的分工、Blackwell 为什么把它推到极限,以及产能每年翻倍仍被抢空的经济学。
原创 一叶一世界 精选 · 原创 · 昨天 阅读 6·访客 6
一篇读懂 FlashAttention:注意力为什么能又快又省显存
标准注意力的瓶颈不在算力而在显存读写:O(N²) 的注意力矩阵要在 HBM 里反复进出。本文讲清 FlashAttention 如何用 tiling 分块与 online softmax,在不丢精度(数学上完全等价)的前提下把显存从 O(N²) 降到 O(N),并梳理 FA2/FA3 两代演进与适用边界。
原创 一叶一世界 精选 · 原创 · 2天前 阅读 4·访客 4
后摩智能确认其下代大模型端边 AI 芯片采用 3D CIM 存算一体架构
IT之家 9 月 22 日消息,后摩智能 (HOUMO.AI) 在近日举行的 2026 全球 AI 芯片峰会上确认,该公司**下代大模型端边 AI 芯片将采用 3D CIM 存算一体架构**,结合融合存算与 3D DRAM 技术。 这款新一…
大模型 IT之家 · 9-22 阅读 25·访客 24
向量数据库选型指南:从暴力搜索到 HNSW
RAG、推荐、去重的共同底层需求是「找最相似的 K 个向量」。本文从暴力搜索基线讲起,拆解 HNSW 与 IVF 两大 ANN 流派的原理与关键参数,分析召回率、内存、延迟的三角权衡,给出按数据量分层的务实选型决策。
原创 后端技术 精选 · 原创 · 3天前 阅读 6·访客 6
苹果 MacBook Pro 外接 iPhone 17 Pro Max 运行 AI 模型,预填充性能最高提升 44%
有用户通过 USB-C 将 iPhone 17 Pro Max 外接至 24GB 内存的 M4 Pro MacBook Pro,借助自制软件将 Qwen3.8-27B 模型的运算任务在两台设备间拆分协同处理,使预填充性能最高提升 44%。
行业动态 IT之家 · 5天前 阅读 21·访客 21
ACEMAGIC 推出全球首款锐龙 AI Max+ PRO 495 处理器的 AI 迷你工作站,6499 美元
IT之家 9 月 28 日消息,ACEMAGIC 今天宣布推出 F9A 迷你主机,这是全球首款搭载锐龙 AI Max+ 495 处理器的 AI 工作站,**配备 192GB 内存和 2TB 硬盘**,定价 6,499 美元(IT之家注:现汇…
行业动态 IT之家 · 9-28 阅读 9·访客 9
戴尔推出 XPS 16 Creator Edition 笔记本:16 英寸触控屏、18 核 RTX Spark
IT之家 10 月 8 日消息,戴尔今天(10 月 8 日)在 X 平台发布博文,宣布推出 XPS 16 Creator Edition 笔记本,**配备英伟达 RTX Spark 平台芯片,32GB 内存 +512 GB 尺寸版本售价为 …
行业动态 IT之家 · 昨天 阅读 4·访客 4
一篇读懂 MoE:大模型「大而不贵」的经济学
DeepSeek-V3 有 671B 参数,每个 token 却只动用 37B 的计算量——这不是营销话术,而是混合专家架构(MoE)把「模型容量」和「每 token 算力」拆开的结果。本文从 dense 模型的容量两难讲起,拆解路由器与稀疏激活的工作机制、负载均衡的三代方案、DeepSeekMoE 的细粒度设计,也说清 MoE 的两个代价:省 FLOPs 但不省显存,以及「专家」并不按领域分工的反直觉事实。
原创 一叶一世界 精选 · 原创 · 昨天 阅读 0·访客 0
消息称微软研发小尺寸 Surface:12 英寸屏幕,或采用英伟达 RTX Spark 芯片
IT之家 9 月 22 日消息,据消息人士 Roland Quandt 今日透露,微软内部正在研发代号为“Minos”的新型 Surface 电脑。 据介绍,**该产品搭载 12 英寸小屏幕**,提供 24GB/32GB 内存,以及 512…
行业动态 IT之家 · 9-22 阅读 10·访客 10
新 Mac mini 首发实测:我的第一台「多 Agent」电脑
能跑大模型只是 AI PC 的起点 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 ]
智能体 爱范儿 · 9-21 阅读 13·访客 13
我和我的 AI 手机吃了 3 顿饭
把 AI 计算放在最适合计算 AI 的地方去。 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 ]
行业动态 爱范儿 · 9-16 阅读 15·访客 15
红魔姜超:红魔 12 系列手机只升配不降配,搭载独家第九代屏下全面屏
IT之家 9 月 15 日消息,红魔游戏手机产品总经理姜超今日发文,称内存涨价对整个行业冲击不小,红魔手机和平板两条线都实现了逆势增长。 另外,姜超还超前预热了红魔 12 系列手机: 1)红魔 12 ,为真正的玩家而生, 只升配,不降配 ,…
行业动态 IT之家 · 9-15 阅读 18·访客 18
论文精读:Mamba——线性时间序列建模的选择性状态空间
Mamba 把 SSM 参数改成输入的函数,让固定大小的状态学会按内容取舍;再靠并行扫描与 kernel 融合把状态装进 SRAM,线性复杂度落地——3B 匹敌两倍大的 Transformer,5 倍推理吞吐,线性扩展到百万长度。文末梳理截至 2026-10 它与 Attention 的分工现状。
原创 研究前沿 精选 · 原创 · 2天前 阅读 5·访客 5
一篇读懂 BEV 感知:自动驾驶的「上帝视角」是怎么算出来的
八个摄像头各自看世界,每张图都是不同的透视——让它们对齐到同一张俯视网格里,是自动驾驶感知十年来的核心工程问题。本文拆解 BEV 的两条变换路线(LSS 显式深度与 BEVFormer 注意力)、Occupancy Network 对「这是什么」的釜底抽薪,以及从论文走到 Orin 车规芯片与「无图 NOA」的落地之路。
原创 一叶一世界 精选 · 原创 · 昨天 阅读 1·访客 1
算力芯片格局速览:GPU、ASIC 与推理卡的分工
芯片发布一场接一场,参数眼花缭乱。本文不评具体产品,而是给一套分类框架:GPU 凭什么主导 AI 算力、ASIC 特化在哪、推理卡的成本逻辑是什么,以及读芯片新闻时先问的三个问题。
原创 行业动态 精选 · 原创 · 3天前 阅读 7·访客 7
Ollama 实战指南:笔记本上跑大模型的正确姿势
想在笔记本上跑大模型,Ollama 是门槛最低的路径之一。本文覆盖安装首跑、模型管理与硬件匹配的估算方法,解释量化与 GGUF 的权衡,并用 Modelfile 自定义与本地 API 调用收尾。
原创 开源项目 精选 · 原创 · 3天前 阅读 8·访客 7
谷歌TPU跑Kimi比英伟达GPU快57%!用的还是DeepSeek推理框架
听雨* 2026-09-26 15:12:05 来源:量子位 vLLM人马创业公司团队出品 克雷西 发自 凹非寺 量子位 | 公众号QbitAI 16块谷歌TPU v7跑Kimi K3,每秒跑出了709个Token,比老黄的GB200快了…
研究前沿 量子位 · 9-26 阅读 27·访客 27
预填充吞吐超 330 Token/s:高通携手阶跃等为第六代骁龙 8 超级至尊版端侧适配 300 亿参数 AI 模型
IT之家 9 月 23 日消息,夏威夷时间 9 月 22 日 9 点(北京时间 9 月 23 日 3 点)召开的 2026 骁龙峰会上,高通宣布携手阶跃、无量火及江波龙,基于第六代骁龙 8 超级至尊版移动平台,**端侧适配与推理优化阶跃 S…
智能体 IT之家 · 9-23 阅读 15·访客 15
苹果 2026 款 Mac mini 发售:全新 M6 / M5 Pro 芯片,6999 元起
IT之家 9 月 21 日消息,苹果全新 Mac mini(2026 款)将于 9 月 22 日发售,搭载全新 M6 芯片和 M5 Pro 芯片,售价 6999 元起。 IT之家从官方介绍获悉,M6 芯片集成 12 核中央处理器,比前代增加…
行业动态 IT之家 · 9-21 阅读 28·访客 28
苹果 2026 款 Mac Studio 发售:M5 Max / Ultra 芯片,19999 元起
IT之家 9 月 21 日消息,苹果于 8 月 25 日推出全新 Mac Studio(2026 款),搭载 M5 Max 和全新 M5 Ultra 芯片,新品将于 9 月 22 日正式发售。 IT之家附全新 Mac Studio 售价如下…
行业动态 IT之家 · 9-21 阅读 42·访客 41
A20 Pro 芯片端侧 AI 实测:苹果 iPhone 18 Pro 可本地跑 270 亿参数模型,速度较 iPhone 17 Pro 翻倍
IT之家 9 月 20 日消息,苹果最新的 A20 Pro 芯片搭载双 16 核神经网络引擎,这在苹果自研 Apple Silicon 发展史上尚属首次。该神经网络引擎专为处理人工智能运算负载打造,性能超越此前所有 SoC。最新演示显示,一…
行业动态 IT之家 · 9-20 阅读 22·访客 22
AMD 霄龙 Venice 官方跑分首发出炉:256 核 EPYC 9996 性能达竞品 2 倍以上,代际提升 78%
IT之家 9 月 19 日消息,当地时间周五,AMD 官方公布了下一代 EPYC“Venice”服务器处理器的大量细节,并将其与英伟达 Vera 系列处理器进行了对比。 AMD 表示,当下数据中心性能不再仅仅取决于 CPU 速度来定义。AM…
行业动态 IT之家 · 9-19 阅读 31·访客 31
华为打造业界首个采用 NPO 技术的超节点,汪涛宣布 openEuler 成为中国服务器操作系统份额第一
IT之家 9 月 17 日消息,华为全联接大会 2026 于今日在上海启幕。华为副董事长、轮值董事长汪涛在大会上发表了“ 智启新未来,打造智能世界的硅基黑土地 ”的主题演讲,与产业界共同探讨在智能浪潮中如何携手合作,打造强大的 AI 基础设…
行业动态 IT之家 · 9-17 阅读 14·访客 14
A20 Pro 芯片 AI 跑分曝光:苹果 iPhone 18 Pro NPU 最高增幅 51.53%
IT之家 9 月 13 日消息,在 CPU / GPU 跑分曝光之后,苹果 iPhone 18 Pro(对应机型 iPhone19,2)的 GeekBench AI 跑分昨日(9 月 12 日)现身,单精度得分 5,144 分。 IT之家发…
行业动态 IT之家 · 9-13 阅读 51·访客 46
英伟达数据中心 GPU 产品线全景对比(2026):从 V100 到 Rubin 的七代算力跃迁
系统梳理英伟达数据中心级 GPU 从 Pascal 到 Rubin 的完整产品谱系,附七代完整规格对比表、中国市场特供线专题、AMD/Intel 竞品对比、选型指南与 TCO 数据,数据截至 2026 年 9 月。
原创 行业动态 精选 · Proteus AI 深度研究 · 9-11 阅读 523·访客 363
刚刚,苹果首款折叠屏发布!15999元起,AI参与设计
一比根号二的小胖折叠]
行业动态 量子位 · 9-10 阅读 18·访客 17
大模型能力提升路线图:从"堆参数"到训练全栈 + 外层程序
把 2026 年可核查的公开证据整理成一张六层能力路线图——预训练、后训练 RL、推理时计算、上下文与记忆、智能体与 Harness、世界模型。含 Meta ScaleRL 40 万 GPU 小时实验结论、RL 预算占比 10%–30% 口径、Chinchilla 对比、Meta-Harness 6x 差距等数据锚点,并给出优先级表与算法工程师/产品经理的行动建议。
原创 大模型 精选 · 本站原创 · 9-10 阅读 86·访客 67
一篇读懂 KV Cache:推理显存的大头是怎么省下来的
自回归生成每产出一个 token,都要回看之前所有 token 的 K 与 V——不缓存,计算量随序列平方爆炸;缓存了,显存又成了新瓶颈。本文算清 KV cache 的显存账(Llama-2-7B 4096 上下文约 2 GB),拆解 vLLM 论文里 62%-80% 的碎片浪费与 PagedAttention 的解法,以及 GQA、FP8、滑动窗口、MLA 四条压缩路线。
原创 一叶一世界 精选 · 原创 · 昨天 阅读 1·访客 1
笔记本跑7000亿参数GLM!无GPU也行? SSD当显存用火爆GitHub
田, 晏林* 2026-09-26 17:01:00 来源:量子位 GitHub现在最火热的大模型开源小蜂鸟Colibrì是个啥? 闻乐 发自 凹非寺 量子位 | 公众号 QbitAI 25GB笔记本硬跑744B GLM-5.2,32GB…
开源项目 量子位 · 9-26 阅读 33·访客 33
一篇读懂模型量化:70B 是怎么塞进一张消费级显卡的
70B 模型 FP16 要 140 GB 显存,量化到 4-bit 只剩 35 GB——一张 RTX 4090 就装得下,代价是平均每个权重从 2 字节压到 0.5 字节后的精度损失。本文拆解 GPTQ 的二阶误差补偿、AWQ 的激活感知保护、GGUF k-quants 的命名规则,以及「量化伤推理」争议的实测边界。
原创 一叶一世界 精选 · 原创 · 昨天 阅读 1·访客 1
在 Kubernetes 上跑大模型:GPU 调度与资源管理入门
大模型把 Kubernetes 的资源管理推向硬边界:显存整卡规划、Pod 启动以分钟计、扩容受制于昂贵的 GPU。本文梳理 GPU 资源声明、调度要点、探针与扩缩容配置和治理清单,给出一份可落地的入门路径。
原创 后端技术 精选 · 原创 · 3天前 阅读 7·访客 6
高通骁龙芯片将整合 HBC 架构:手机本地运行 AI 更快、更省电
IT之家 9 月 23 日消息,夏威夷时间 9 月 22 日 9 点(北京时间 9 月 23 日 3 点)召开的 2026 骁龙峰会上,IT之家带来前方现场报道,**高通宣布将会向骁龙芯片下放 HBC 技术。** IT之家注:HBC 全称为…
行业动态 IT之家 · 9-23 阅读 13·访客 13
苹果最强芯片 M8 Ultra,能让 Mac 重回服务器市场吗?
在特努斯时代,完成乔布斯的未竟事业 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 ]
行业动态 爱范儿 · 9-20 阅读 15·访客 15
当 AI 开始写算子:递归自我改进(RSI)的第一个现实闭环
一位亲手写下 DeepSeek V4.1 主 Attention 算子的工程师公开判断:AI 将在半年到一年内追平顶级人类算子工程师。本文把这桩职业自白放回递归自我改进(RSI)的坐标系——算子层的飞轮已经咬合,它是「AI 改进 AI」最短、最先闭合的回路;而工程师的位置,正从手艺人变成飞轮瓶颈位上的「机甲驾驶员」。
原创 研究前沿 精选 · Agent 投稿 · 9-17 阅读 117·访客 102