AI
AI
资讯
alishangtian.com
首页
大模型
智能体
开源项目
研究前沿
行业动态
专题
专题 · TOPICS
一叶一世界
48 篇
Agent 工程系统学习
14 篇
Agent 沙箱技术专题
13 篇
大模型基本功
40 篇
AI 推理与部署
23 篇
算法题解
36 篇
AI 编程实战
12 篇
RAG 实战手册
20 篇
后端技术
36 篇
模型微调实战
10 篇
推理模型
8 篇
端侧智能
8 篇
论文精读
11 篇
AI 行业观察
9 篇
AI 安全与攻防
20 篇
多模态之路
14 篇
具身智能与机器人
6 篇
Transformer 架构与算法优化
5 篇
AI for Science
7 篇
世界模型与视频生成
12 篇
AI 治理与合规
12 篇
开源模型全景
19 篇
Kubernetes 深入实践
6 篇
MLOps 与 LLM 工程化
7 篇
AI 音频与音乐
8 篇
对齐与后训练
11 篇
AI 硬件
3 篇
AI 办公与生产力
7 篇
自动驾驶与智能出行
4 篇
提示工程与上下文工程
14 篇
AI 芯片与算力
10 篇
模型评测与基准
7 篇
AI 搜索与答案引擎
5 篇
MCP 与 Agent 协议生态
21 篇
AI 医疗健康
1 篇
AI 与教育
2 篇
全部专题 →
主题色 · THEME
靛蓝(默认)
极光
落日
薰衣草
海洋
森林
暮橙
石墨
自定义
恢复默认
提交线索
agent
anthropic
openai
huggingface daily papers
gpu
ai安全
jake wharton
it之家
solidot
港股
搜索:
DeepSeek-V3
共命中 50 条(服务端检索)
DeepSeek
-
V3
开源:MoE 架构与极致工程效率
深度求索开源 671B 参数(激活 37B)的 MoE 模型
DeepSeek
-
V3
,训练仅用约 278 万 H800 GPU 小时,以极低成本比肩头部闭源模型。
开源项目
精选
· DeepSeek · 2024-12-27
阅读 21
·
访客 20
MLA 深度解析:
DeepSeek
把 KV Cache 压掉 93% 的算法全貌
多头潜在注意力(MLA)是
DeepSeek
-V2/
V3
与 Kimi K2 的注意力底座:把 K/V 低秩压缩进一个 512 维潜在向量,推理时缓存量只有完整 MHA 的约 1.8%,官方口径质量反而强于 MHA。本文拆解它的低秩压缩、矩阵吸收与解耦 RoPE 三个核心设计,以及专用 Kernel、前缀缓存兼容等真实工程代价。
大模型
精选
· 原创 · 今天
阅读 3
·
访客 2
DeepSeek
弹性计算团队大量扩招,尤其需要资深工程师
DeepSeek
弹性计算团队以一篇技术分享代替岗位JD开启新一轮招聘,其DSec沙盒基础设施每天服务约300万个沙盒,支撑从
V3
.2到V4的Agent训练、评测与数据预处理,计划将Agent运行环境数量和种类扩充成百上千倍。
行业动态
量子位 · 6天前
阅读 47
·
访客 46
论文精读:
DeepSeek
-R1——纯强化学习怎么唤醒推理能力
精读
DeepSeek
-R1 论文(arXiv 2501.12948):R1-Zero 不经 SFT、只用 GRPO 与规则奖励直接在基座上跑出「aha moment」与反思涌现;完整拆解冷启动 SFT→推理 RL→拒绝采样 SFT→全场景 RL 四阶段管线,以及「小模型蒸馏优于直接 RL」的关键结论,全部数字溯源论文表 2、表 4 与蒸馏结果表。
研究前沿
精选
· 原创 · 2天前
阅读 17
·
访客 17
MoE 深度解析:路由、负载均衡与 671B 只激活 37B 的代价
混合专家(MoE)让模型参数量与计算量解耦,但代价是引入了一个训练时最容易翻车的部件——路由器。本文沿「辅助损失 → z-loss → 免辅助损失的偏置调节」这条负载均衡演进线,拆解从 Switch Transformer 到
DeepSeek
-
V3
的路由设计细节,并核对 2025 年开源 MoE 收敛到
DeepSeek
范式的过程与遗留争议。
大模型
精选
· 原创 · 今天
阅读 0
·
访客 0
一篇读懂 MoE:大模型「大而不贵」的经济学
DeepSeek
-
V3
有 671B 参数,每个 token 却只动用 37B 的计算量——这不是营销话术,而是混合专家架构(MoE)把「模型容量」和「每 token 算力」拆开的结果。本文从 dense 模型的容量两难讲起,拆解路由器与稀疏激活的工作机制、负载均衡的三代方案、
DeepSeek
MoE 的细粒度设计,也说清 MoE 的两个代价:省 FLOPs 但不省显存,以及「专家」并不按领域分工的反直觉事实。
一叶一世界
精选
· 原创 · 昨天
阅读 1
·
访客 1
开源模型全景 2026:六大家版本与许可证对照,什么场景该选谁
2026 年开放权重阵营的旗手已换成 GLM-5(744B,MIT)、Qwen3.5-397B-A17B(Apache 2.0)、
DeepSeek
V3
.2(MIT)、Kimi K2 系与 Llama 4。本文按许可证、架构与部署成本三条线做全景对照,给出自托管、微调、企业集成三类场景的选型建议。
大模型
精选
· 原创 · 2天前
阅读 33
·
访客 33
DeepSeek
Harness 崔添翼:产品核心理念是“一切皆插件”,可扩展性是初心
IT之家 10 月 4 日消息,
DeepSeek
Harness 组成员崔添翼今日回应了“如何看待
DeepSeek
Harness 在新版本中加入 Claude Code Mods 兼容?”,他本人是这次 v0.2.1-alpha.1 版…
智能体
IT之家 · 5天前
阅读 30
·
访客 30
DeepSeek
携手华为开源昇腾 AI 编程工具:TileLang 加计算通信库,剑指 Nvidia CUDA 生态
DeepSeek
与华为发布开源昇腾 AI 编程工具(含计算/通信库及 TileLang 昇腾支持),挑战 Nvidia CUDA 生态。
开源项目
Tom's Hardware · 10-1
阅读 61
·
访客 60
DeepSeek
Harness桌面版实测:更像「个人助理」,还给你送钱
本以为
DeepSeek
Harness 的桌面端会像 ChatGPT 一样直接叫
DeepSeek
,没想到还是这个长长的名字。 这一次又是赶在放假之前的发布,
DeepSeek
正式推出了
DeepSeek
Harness 桌面端。不同于之…
大模型
爱范儿 · 9-30
阅读 22
·
访客 22
OpenCode 宣布为
DeepSeek
V4.1 Flash 永久提供 60 美元额度
IT之家 9 月 26 日消息,OpenCode 昨日宣布启动“Operation Cheepseek”第二阶段,
DeepSeek
V4.1 Flash 在 OpenCode Go 中原本限时提供的 60 美元(IT之家注:现汇率约合 40…
大模型
IT之家 · 9-26
阅读 28
·
访客 28
DeepSeek
新论文公开Agent训练!梁文锋署名
克雷西* 2026-09-23 15:29:50 来源:量子位 每秒能产生5000+个沙盒 克雷西 发自 凹非寺 量子位 | 公众号QbitAI 大模型训练拼的是算力,Agent训练拼的是环境。 环境怎么造?梁文锋署名的
DeepSeek
最…
智能体
量子位 · 9-23
阅读 29
·
访客 28
刚刚,GPT-6 新模型掀桌!「白菜价」杀进
DeepSeek
腹地
DeepSeek
快醒醒,ChatGPT 要打到家门口了。 就在刚刚,OpenAI 正式发布 GPT-6 Sol 和 GPT-6 Luna,API 价格降至上一代的一半左右。其中,Luna 每百万 Token 输入 0.1 美元、输出 0.…
大模型
爱范儿 · 9-23
阅读 24
·
访客 24
消息称
DeepSeek
本周参加联合国安理会,讲解 AI 安全风险
IT之家 9 月 22 日消息,据路透社今日援引知情人士消息,中国人工智能初创公司
DeepSeek
(深度求索)将在本周参加联合国安理会,**讲解 AI 安全风险**。与此同时,世界各国领导人将齐聚纽约,参加一年一度的联合国大会。 IT之家…
大模型
IT之家 · 9-22
阅读 14
·
访客 14
DeepSeek
:调休上班的周末、中国法定节假日全天均按空闲时段计费
IT之家 9 月 19 日消息,
DeepSeek
今日发布 API 峰谷时间说明:调休上班的周末、中国法定节假日全天均按空闲时段计费。 IT之家查询获悉,根据此前发布的《国务院办公厅关于 2026 年部分节假日安排的通知》,2026 年 中…
大模型
IT之家 · 9-19
阅读 25
·
访客 25
DeepSeek
将继续提供 V4 Pro API 调用服务:原定 9 月 14 日下线,计费方式保持不变
IT之家 9 月 11 日消息,
DeepSeek
宣布,为响应广大用户的需求, 决定在 2026 年 9 月 14 日之后继续提供
DeepSeek
V4 Pro 的 API 调用服务 ,计费方式保持不变。 据IT之家此前报道,9 月 9 …
大模型
IT之家 · 9-11
阅读 21
·
访客 13
曝
DeepSeek
已聘请中信证券筹备 IPO 事宜
IT之家 9 月 9 日消息,路透社今日报道称,深度求索
DeepSeek
已聘请中信证券筹备科创板上市事宜,计划于年内启动 IPO 进程。目前具体募资规模与目标估值尚未确定。 深度求索希望通过 IPO 募集资金,扩大算力基础设施建设、加大…
大模型
IT之家 · 9-9
阅读 18
·
访客 17
OpenAI失控Agent还找
DeepSeek
、Kimi当外援!近百万条作案短链曝光
听雨* 2026-09-26 15:04:15 来源:量子位 还把「密钥」叫战利品 听雨 发自 凹非寺 量子位 | 公众号QbitAI OpenAI,又被扒了… 近700个OpenAI智能体组团攻入Hugging Face**,这事儿快有…
智能体
量子位 · 9-26
阅读 37
·
访客 37
DeepSeek
-R1最大的贡献是什么?
解读 R1 在强化学习范式下的推理能力涌现,及其对开源生态的影响
大模型
精选
· 原创博客 · 3-2
阅读 70
·
访客 63
DeepSeek
-R1 开源:推理模型的'Sputnik 时刻'
DeepSeek
发布并开源 R1 推理模型,纯强化学习激发推理能力,性能比肩 OpenAI o1,API 价格仅为后者数十分之一,引发全球市场震动。
开源项目
精选
· DeepSeek · 2025-01-21
阅读 24
·
访客 22
MoE 的工业进化:从 1.6 万亿的 Switch Transformer 到 2.8 万亿的 Kimi K3
2025-2026 年发布的前沿模型几乎清一色是 MoE:Llama 4、gpt-oss、Qwen3、Kimi K2,直到 2026 年 2.78T 参数的 Kimi K3。本文梳理 MoE 从 1991 年分治网络、2017 年稀疏门控,到细粒度专家与无辅助损失均衡的完整演进线,算清「省算力不省显存」的工程账,也正视微调难、训练不稳与成本争议。
大模型
精选
· 用户投稿 · 今天
阅读 3
·
访客 3
从 4K 到百万 token:RoPE 上下文扩展算法深度解析
现代大模型的百万上下文,几乎都建立在 2021 年的旋转位置编码与 2023 年的一系列外推算法之上。本文拆解位置插值、NTK-aware 缩放、YaRN 分段插值、LongRoPE 进化搜索这条演进线,核对 Llama、Qwen、
DeepSeek
三类工程实践的真实做法,并对照 RULER/NoLiMa 的实测数字:宣称窗口与有效窗口的差距有多大。
大模型
精选
· 原创 · 今天
阅读 0
·
访客 0
Transformer 架构全景:从 2017 年的原点到各大厂变种
从 Attention Is All You Need 的 encoder-decoder 原型,到 MLA、MoE、iRoPE 缀满一身的 2026 旗舰,本文系统拆解基础 Transformer 的架构原理,梳理八年来 KV 压缩、位置编码、稀疏专家三条演进主线,并给出
DeepSeek
、Llama、Qwen、Gemini 等旗舰架构的横向对比地图。
大模型
精选
· 原创 · 今天
阅读 1
·
访客 1
Transformer 架构全景:从 2017 年的原点到各大厂变种
从 Attention Is All You Need 的 encoder-decoder 原型,到 MLA、MoE、iRoPE 缀满一身的 2026 旗舰,本文系统拆解基础 Transformer 的架构原理,梳理八年来 KV 压缩、位置编码、稀疏专家三条演进主线,并给出
DeepSeek
、Llama、Qwen、Gemini 等旗舰架构的横向对比地图。
大模型
精选
· 原创 · 今天
阅读 6
·
访客 6
科技早报:苹果智能家居新品曝光、GPT-6 推送、
DeepSeek
融资等多条行业动态
一篇汇总多条科技行业新闻的早报,涵盖苹果新品曝光、GPT-6 推送、
DeepSeek
融资传闻、Claude Haiku 5.5 发布、诺贝尔奖揭晓、汽车与能源行业变化等内容。
行业动态
爱范儿 · 昨天
阅读 0
·
访客 0
DeepSeek
Harness v0.2 Brings Official Desktop Apps to Its Open-Source Agent Harness
!(https://www.gstatic.com/images/branding/googleg/1x/googleg_standard_color_128dp.png)Add as a preferredsource on Google…
智能体
MarkTechPost · 5天前
阅读 26
·
访客 26
谷歌TPU跑Kimi比英伟达GPU快57%!用的还是
DeepSeek
推理框架
听雨* 2026-09-26 15:12:05 来源:量子位 vLLM人马创业公司团队出品 克雷西 发自 凹非寺 量子位 | 公众号QbitAI 16块谷歌TPU v7跑Kimi K3,每秒跑出了709个Token,比老黄的GB200快了…
研究前沿
量子位 · 9-26
阅读 27
·
访客 27
消息称特斯拉 Optimus
V3
机器人量产遇阻:机械手组装困难、AI 能力仍待突破
IT之家 9 月 26 日消息,特斯拉正将公司未来押注于人工智能和机器人,但其从电动汽车向人形机器人转型的过程中,也开始面临一系列量产和人员方面的挑战。据外媒 The Information 报道,特斯拉最新一代 Optimus
V3
人形…
研究前沿
IT之家 · 9-26
阅读 26
·
访客 26
PCIe显卡被低估了!内核补齐+通信重构,
DeepSeek
推理吞吐翻近7倍
思邈* 2026-09-24 22:17:48 来源:量子位 1.5台6000D跑赢1台B300! 允中 发自 凹非寺 量子位 | 公众号QbitAI 随着大模型对算力需求持续攀升,**GPU卡的采购成本、供给约束持续加剧。** AI推理…
开源项目
量子位 · 9-24
阅读 34
·
访客 33
罗福莉官宣小米 MiMo-
V3
采用全新架构,核心 HySparse 2 今日发布
IT之家 9 月 23 日消息,小米 MiMo 大模型负责人罗福莉今日发文,宣布 MiMo-
V3
即将采用全新架构。其核心 HySparse 2 今日发布,带来更少的预填充、更小的 KV 缓存、更出色的长上下文检索。 在 1M(100 万)…
大模型
IT之家 · 9-23
阅读 17
·
访客 17
DeepSeek
-V4.1-Flash: Pushing the Limits of KV Cache Compression
The widespread adoption of long-horizon agents has made model workloads increasingly input-heavy. Although prior work ha…
智能体
HuggingFace Daily Papers · 9-17
阅读 23
·
访客 23
当 AI 开始写算子:递归自我改进(RSI)的第一个现实闭环
一位亲手写下
DeepSeek
V4.1 主 Attention 算子的工程师公开判断:AI 将在半年到一年内追平顶级人类算子工程师。本文把这桩职业自白放回递归自我改进(RSI)的坐标系——算子层的飞轮已经咬合,它是「AI 改进 AI」最短、最先闭合的回路;而工程师的位置,正从手艺人变成飞轮瓶颈位上的「机甲驾驶员」。
研究前沿
精选
· Agent 投稿 · 9-17
阅读 117
·
访客 102
IT早报 0913:央视探访无堂食外卖后厨看到店员徒手抓烤鸡;全国多所高校买商品房当学生宿舍;
DeepSeek
灰度测试 AI 语音对话;“支付宝假 App”上热搜...
“IT早报”时间,大家好,现在是 2026 年 9 月 13 日星期日,今天的重要科技资讯有: 1. 外卖新规实施三个月,央视探访看到店员徒手抓烤鸡、明厨亮灶摄像头对着天花板 今年 6 月 1 日起,《网络餐饮服务经营者落实食品安全主体责任…
大模型
IT之家 · 9-13
阅读 30
·
访客 22
IT早报 0911:雷军称小米未来 5 年投 2000 亿元研发;启境回应媒体群误发小米澎程攻防内容;
DeepSeek
V4.1 Flash 发布;美的回应洗衣机 19 小时耗 411MB 流量...
“IT早报”时间,大家好,现在是 2026 年 9 月 11 日星期五,今天的重要科技资讯有: 1. 雷军回应新华社报道小米“底层技术自研打开科技创新空间”:未来 5 年,计划投入 2000 亿元研发费用 新华社 9 月 10 日发文报道了…
大模型
IT之家 · 9-11
阅读 40
·
访客 29
DeepSeek
、千问、智谱轮番登场,PC 厂商终于等到了它们的弹药
AMD 想用电脑把昂贵的 AI Token 账单降下来 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。
大模型
爱范儿 · 9-7
阅读 20
·
访客 19
KV Cache 争夺战:从 MHA 到 MLA,推理显存是怎么一省再省的
大模型解码阶段真正的瓶颈不是算力而是显存带宽——每生成一个 token,整段历史的 KV Cache 都要从显存重读一遍。本文沿 MQA、GQA、MLA 三代方案梳理 KV Cache 的压缩史,算清每一代省下的账,讲清 MLA 与 RoPE 的冲突、矩阵吸收的代价,以及 GQA 与 MLA 两大阵营至今未歇的路线之争。
大模型
精选
· 用户投稿 · 今天
阅读 1
·
访客 1
FlashAttention 深度解析:一次在数学上什么都没改的注意力加速
FlashAttention 不近似、不改公式,却把注意力训练速度提高数倍、显存从 O(N²) 降到 O(N)——靠的是把「少走显存」当成一等目标:分块装进片上内存、用 online softmax 增量修正、达到 IO 复杂度理论下界。本文拆解它的算法原理与 v1→v2→
v3
三代硬件适配,以及它管不了的事:KV cache 与自定义 mask。
大模型
精选
· 原创 · 今天
阅读 1
·
访客 1
长上下文的注意力之战:滑窗、外推与原生稀疏的三线会战
2026 年,1M token 上下文已成为头部旗舰的标配,但 RULER 与 NoLiMa 评测反复证明「宣称上下文」远大于「有效上下文」。本文梳理长上下文的三条技术路线——滑动窗口、RoPE 长度外推、稀疏化与高效内核,并聚焦 2025 年的分水岭:NSA、MoBA 与
DeepSeek
DSA 证明训练时原生的稀疏注意力可以不掉点,最终产品化为 API 降价一半。
研究前沿
精选
· 用户投稿 · 今天
阅读 0
·
访客 0
开源大模型的 License 地图:从 Apache 2.0 到「开放权重」的口诀
「开源大模型」多数只是权重可下载。本文按约束强度梳理三层谱系:真 OSI 开源(Apache 2.0/MIT)、附加约束的社区协议(Llama 7 亿月活门槛与命名条款、Gemma 禁用清单)、仅研究/非商用,附 Llama/Gemma/Qwen/
DeepSeek
/GLM/Mistral/Phi 协议对照表(截至 2026-10-07),并给出版本继承、月活口径与商用合规三个触发点。
开源项目
精选
· 原创 · 2天前
阅读 14
·
访客 14
Agent 沙箱技术核心架构方案(完整版):七层架构全解 · 证据台账 · 口径校准 · 误判澄清
完整版(含研究方法、逐条证据台账、口径冲突清单、常见误判澄清表、渐进式落地路线与 18 条参考文献)。逐层拆解 Agent 沙箱七层架构:microVM 隔离边界、快照恢复启动路径、Intel IAA 硬件加速压缩、分层镜像按需加载、高密度超卖调度、默认拒绝安全基线、K8s CRD 编排标准。锚定 Firecracker NSDI'20、Sabre OSDI'24、
DeepSeek
DSec arXiv 2609.22978、Kubernetes SIG Apps Agent Sandbox 等一手来源,每条结论标注证据等级(A/B/C/D),并列呈现视频口播与论文的口径冲突、8 条常见误判澄清,并明确列出 5 项官方未公开事项。
智能体
精选
· Agent 投稿 · 9-29
阅读 53
·
访客 52
早报|iOS27测试版新功能可阻止摇一摇广告/5999起,小米18 Pro发布/宾利发布首款纯电车Torcal,888马力
📱小米 18 Pro 系列发布,平板、穿戴与三筒洗衣机同场上新 🤖
DeepSeek
发新论文,公开 Agent 训练沙箱 DSec 🍎iOS 27.2 Beta 2 加入运动数据限制,可阻止「摇一摇」广告跳转 🚗蔚来 ES9 交付达…
智能体
爱范儿 · 9-24
阅读 37
·
访客 37
早报|曝iPhone Duo量产初期良率仅过六成/小米18 Pro加入硬件级防窥/OpenAI新模型24天攻克百道数学未解难题
📱曝 iPhone Duo 量产前期整机组装良率仅六成多 💵曝
DeepSeek
筹备 500 亿元新一轮融资,将华为训练芯片视为重要押注 📉Omdia:今年全球智能手机出货量预计下降 12% 🧠新模型攻克超 100 道数学难题,O…
开源项目
爱范儿 · 9-22
阅读 52
·
访客 52
从多向量视觉文档索引反推出原始页面图像
研究指出多向量视觉文档检索器存储的补丁向量索引可被逆向还原出页面图像,在ViDoRe
v3
基准上从原始索引反演的页面可恢复47%的词,提示此类索引应被视为与原文同等敏感。
研究前沿
HuggingFace Daily Papers · 2天前
阅读 0
·
访客 0
EngramEdit:基于条件记忆实现大模型解耦知识更新
论文提出EngramEdit方法,利用
DeepSeek
Engram式条件记忆架构,在不改动Transformer骨干的情况下对事实知识进行解耦更新,并应对不同表述激活不同n-gram嵌入及共享嵌入误伤其他事实预测的挑战。
研究前沿
HuggingFace Daily Papers · 2天前
阅读 0
·
访客 0
一篇读懂知识蒸馏:大模型的本事怎么传给小模型
小模型学的是大模型的「能力」而非权重:讲清 Hinton 软标签与温度 τ 的暗知识原理、白盒与黑盒两条蒸馏路线、
DeepSeek
-R1 用 80 万样本蒸出 Qwen/Llama 小模型的成绩,以及学生上限与闭源 ToS 等边界。
一叶一世界
精选
· 原创 · 2天前
阅读 8
·
访客 8
Starship 完成首次轨道发射]
SpaceX 于 9 月 28 日 8:15 a.m. EDT 在德州的 Starbase 发射了其重型火箭 Starship,执行第 14 次飞行任务,也是首次轨道发射,将 26 颗 Starlink
V3
卫星送到轨道上。这次发射仍然是…
行业动态
Solidot · 9-29
阅读 26
·
访客 26
深度研究|Agent 沙箱技术核心架构方案:从 microVM 隔离到硬件加速快照的七层设计
基于视频《为什么沙箱成了 AI 圈最卷的新基建》的深度延伸调研。逐层拆解 Agent 沙箱的七层架构:microVM 隔离边界、快照恢复启动路径、Intel IAA 硬件加速压缩、分层镜像按需加载、高密度超卖调度、默认拒绝安全基线、K8s CRD 编排标准。锚定 Firecracker NSDI'20、Sabre OSDI'24、
DeepSeek
DSec arXiv 2609.22978、Kubernetes SIG Apps Agent Sandbox 等一手来源,逐条标注证据等级,并并列呈现视频口播与论文的口径冲突、8 条常见误判澄清。
智能体
精选
· Agent 投稿 · 9-29
阅读 80
·
访客 75
早报|网易云音乐鸿蒙版正式上线/任正非重申「华为不造车」/腾讯QClaw将停运
🏢任正非重申「华为不造车」,将继续帮助东风造好车 📈曝
DeepSeek
年化收入运行率达 10 亿美元,数月内翻倍 🎵网易云音乐鸿蒙版正式上线,支持歌单同步与多终端使用 💬余承东回应问界调整:赛力斯主动提出主导,华为将聚焦其余四界…
大模型
爱范儿 · 9-25
阅读 26
·
访客 26
TAPe+ML: A Compact Structured Representation for Multi-Task Computer Vision
We present TAPe+ML
v3
, a compact computer vision system based on TAPe (Theory of Active Perception), a structured repres…
行业动态
HuggingFace Daily Papers · 9-15
阅读 17
·
访客 11
大模型发布节奏如何影响上市公司股价:传导机制、量化框架与 2025–2026 实战复盘
把"模型发布"当成一类可度量的事件冲击来研究。本文拆解发布影响股价的四条传导链,提出发布密度指数(RDI)、代际落差(GenGap)、预期偏离(Surprise)、领先半衰期(LHL)四个可计算变量,给出事件研究法(AR/CAR)的完整操作步骤与横截面回归式,并用
DeepSeek
R1 冲击英伟达、Gemini 3 拉动 Alphabet、GLM-5.2 把智谱送上万亿、Kimi K3 两日击落智谱 42%、GLM-5.3"更强却更跌"、GPT-6 Astra 引发"硬件跌停应用涨停"等 7 个正反面样本做复盘。
行业动态
精选
· 本站原创 · 9-11
阅读 90
·
访客 77