搜索:ImageNet

共命中 20 条(服务端检索)
机器学习简史(三):AlexNet 点火,深度学习黄金五年
2012 年 10 月,一个用两块游戏显卡训练了五六天的神经网络,把 ImageNet 图像识别错误率从 26% 砍到 15%,整个领域为之改宗。此后五年:ResNet 越过人眼基准、注意力机制埋下 Transformer 的种子、AlphaGo 4:1 击败李世石让全世界重新认识机器学习。本文是「机器学习简史」系列第三篇,用一手论文数据复盘深度学习的黄金五年,也不回避这五年里的「炼金术」之争。
研究前沿 精选 · 原创 · 今天 阅读 3·访客 3
QuadTok:用于自回归图像生成的四叉树视觉分词器
QuadTok 提出基于四叉树的视觉分词方法,对复杂区域动态分配 token、对均匀区域用粗分辨率,在 ImageNet 上节省约 10% token 并在 COCO 零样本迁移时节省 9%,且树结构天然支持自回归图像生成。
研究前沿 HuggingFace Daily Papers · 3天前 阅读 2·访客 2
论文精读:CLIP——四亿图文对如何把图像接入语言空间
CLIP(Radford et al., 2021)用 4 亿网络图文对做对比学习,零样本在 ImageNet 拿到 76.2%——追平全监督的 ResNet-50。本文拆解对比学习的训练机制、零样本分类的「提示词即分类器」玩法、CLIP 的失效模式,以及它如何成为多模态时代的地基。
研究前沿 精选 · 原创 · 3天前 阅读 8·访客 8
何恺明团队新作:看猫片就能学会ARC挑战
鹭羽* 2026-10-01 23:06:30 来源:量子位 用ImageNet训练encoder 克雷西 发自 凹非寺 量子位 | 公众号QbitAI 教会AI做ARC抽象推理题的,竟然是猫猫? 何恺明团队最新论文提出了**NAT-AR…
研究前沿 量子位 · 10-1 阅读 14·访客 14
机器学习简史(二):反向传播与统计学习的中场三十年
深度学习不是 2012 年凭空出现的——1986 年反向传播论文就登上了 Nature,LeCun 的 LeNet 在 1990 年代替银行处理了一成支票。但同期的 SVM 凭理论保证把神经网络压到学科边缘,「两种文化」之争贯穿整个中场。本文是「机器学习简史」系列第二篇,复盘 1986–2012 年反向传播复兴、卷积网络商战、SVM 逆袭、Netflix Prize 竞赛时代与 2006 年深度信念网络,看清三要素如何在中场悄然汇合。
研究前沿 精选 · 原创 · 今天 阅读 3·访客 3
深度学习的数学基础:我们知道它能用,却说不清为什么
2017 年 Ali Rahimi 领奖时说「机器学习变成了炼金术」,LeCun 当场反驳;八年过去,模型能力涨了几个数量级,「为什么泛化」的数学解释仍然是一堆可解模型里的定理。本文盘点深度学习数学基础的现状:随机标签实验、双下降、NTK、grokking、scaling laws 各自被解释到了哪一步,哪一步仍然卡住,以及 2026 年「学习力学」的学科宣言算不算转折点。
研究前沿 精选 · 原创 · 今天 阅读 2·访客 2
一篇读懂学习率:训练里最重要的超参数
梯度只给方向,学习率决定步长。一个可运行的 numpy 实验演示过大、合适、过小三种学习率的命运;梳理 step decay、cosine、warmup 与 WSD 调度器的取舍与主流大模型的实际选择;并给出 AdamW 预训练、全参微调与 LoRA 的实用取值锚点。
一叶一世界 精选 · 原创 · 3天前 阅读 20·访客 20
VLA(视觉-语言-动作)模型进化史:机器人如何「看懂再动手」
从 RT-2 把机器人动作当文本 token 输出,到 OpenVLA 开源 7B、π0 用流匹配跑到 50Hz、GR00T 与 Helix 转向双系统架构——本文梳理 VLA 模型三年的演进脉络:动作怎么表示、参数怎么变小、控制频率怎么上去,以及开源与闭源两条路线的分野。
研究前沿 精选 · 原创 · 3天前 阅读 11·访客 11
一篇读懂 DiT:视频生成模型为什么都换上了 Transformer 主干
从 Peebles 与谢赛宁的 DiT 论文到 Sora 的时空 patch,讲清 Diffusion Transformer 的三个关键设计:patch 化、adaLN-Zero 条件注入与以计算量为标尺的可扩展性。
一叶一世界 精选 · 原创 · 3天前 阅读 10·访客 10
NASA and IBM's open source lunar model turns 17 years of orbiter data into a foundation for lunar science
Oct 4, 2026 Nano Banana Pro prompted by THE DECODER The NASA-IBM Lunar Foundation Model makes decades of lunar observati…
开源项目 The Decoder · 6天前 阅读 29·访客 29
DMAD: Distribution Matching as Adversarial Distillation for Fast Visual Generation
Distribution Matching Distillation (DMD) trains a few-step student from the difference between separately estimated targ…
行业动态 HuggingFace Daily Papers · 10-1 阅读 4·访客 4
AMD 斥资 82 亿美元收购 World Labs,“AI 教母”李飞飞出任执行副总裁兼首席科学家
IT之家 9 月 29 日消息,当地时间 28 日,AMD 宣布同意以全股票交易**收购旧金山初创公司 World Labs**,交易价值约 82 亿美元(IT之家注:现汇率约合 551 亿元人民币)。 World Labs 由李飞飞等人于…
大模型 IT之家 · 9-29 阅读 33·访客 33
苏姿丰550亿元买下李飞飞世界模型,AI 圈两位女王联手了
就在刚刚,芯片巨头 AMD 正式官宣,将收购李飞飞创立仅两年的 AI 独角兽 World Labs。 本次交易将以全股票方式进行,作价约 82 亿美元。目前双方已经签署最终协议,预计在 2026 年底前完成交易,但仍须获得监管批准并满足其他…
行业动态 爱范儿 · 9-29 阅读 13·访客 13
AMD 以 82 亿美元收购李飞飞创立的 World Labs,李飞飞将出任 AMD 首席科学家
AMD 宣布以约 82 亿美元全股票收购李飞飞创立的世界模型公司 World Labs,李飞飞将出任 AMD 执行副总裁兼首席科学家,交易预计 2026 年底前完成。
行业动态 东方财富/东西问 · 9-29 阅读 15·访客 15
VisionHOPE: Visual Backbones as Self-Modifying Learning Systems
Visual backbones have evolved from Convolutional Neural Networks (CNNs) with local aggregation to Vision Transformers (V…
行业动态 HuggingFace Daily Papers · 9-27 阅读 8·访客 8
FuseReg: Regularizing Layer Fusion Mitigates the Reconstruction-Generation Gap in Representation Autoencoders
Representation autoencoders (RAEs) reuse features from a pretrained visual encoder as reconstruction and diffusion laten…
行业动态 HuggingFace Daily Papers · 9-25 阅读 5·访客 5
早报|iOS27测试版新功能可阻止摇一摇广告/5999起,小米18 Pro发布/宾利发布首款纯电车Torcal,888马力
📱小米 18 Pro 系列发布,平板、穿戴与三筒洗衣机同场上新 🤖DeepSeek 发新论文,公开 Agent 训练沙箱 DSec 🍎iOS 27.2 Beta 2 加入运动数据限制,可阻止「摇一摇」广告跳转 🚗蔚来 ES9 交付达…
智能体 爱范儿 · 9-24 阅读 38·访客 38
StableVQ: Practical Guidelines for Stable Vector-Quantized Tokenizer Training
Vector Quantization (VQ) is fundamental to discrete visual tokenizers that power modern autoregressive and masked image …
行业动态 HuggingFace Daily Papers · 9-22 阅读 4·访客 4
Training-Adaptive Convolutional Sparse Coding via Information Bottleneck for Robust Visual Representation
Visual signals require compact yet sufficient representations for robust downstream prediction. Convolutional sparse cod…
智能体 HuggingFace Daily Papers · 9-17 阅读 16·访客 16
TAPe+ML: A Compact Structured Representation for Multi-Task Computer Vision
We present TAPe+ML v3, a compact computer vision system based on TAPe (Theory of Active Perception), a structured repres…
行业动态 HuggingFace Daily Papers · 9-15 阅读 18·访客 12