搜索:图像生成

共命中 50 条(服务端检索)
QuadTok:用于自回归图像生成的四叉树视觉分词器
QuadTok 提出基于四叉树的视觉分词方法,对复杂区域动态分配 token、对均匀区域用粗分辨率,在 ImageNet 上节省约 10% token 并在 COCO 零样本迁移时节省 9%,且树结构天然支持自回归图像生成。
研究前沿 HuggingFace Daily Papers · 2天前 阅读 0·访客 0
阿里千问开源 Qwen-Image-2.1 图像模型:可生成、编辑透明图像,支持最多 10 张参考图
IT之家 9 月 20 日消息,阿里千问今日宣布,开源千问图像系列当前兼顾生成效果、推理效率与使用成本的开源图像模型 Qwen-Image-2.1。 Qwen-Image-2.1 将文生图与图像编辑整合在同一模型中,视觉生成部分仅有 7B …
开源项目 IT之家 · 9-20 阅读 45·访客 44
扩散模型入门:从噪声里「雕刻」出图像
直接让网络输出一张合理的图像为什么难?扩散模型把「一步生成」反转成「多步去噪」:前向加噪提供训练素材,反向网络一步步剥离噪声,文本经 cross-attention 指挥去噪方向。本文讲清这套机制的完整逻辑,并对比扩散与自回归两条路线。
原创 研究前沿 精选 · 原创 · 3天前 阅读 8·访客 8
生图模型 FLUX 3 Image 发布:支持 4K 生成,可精准排布 AI 元素
IT之家 10 月 2 日消息,德国 AI 公司 Black Forest Labs 今天(10 月 2 日)发布公告,宣布推出图像生成 AI 模型 FLUX 3 Image,**支持生成最高 4K 分辨率图片,输出画面在放大后仍保持丰富细…
行业动态 IT之家 · 10-2 阅读 9·访客 9
中国生成式 AI 监管地图:备案双轨、标识新规与开发者的合规清单
备案是中国生成式 AI 监管的主轴:算法备案与大模型备案双轨并行,2025 年 9 月起《人工智能生成合成内容标识办法》与强制性国标 GB 45438-2025 把显式/隐式标识义务落到像素级。本文面向开发者梳理法规层级、备案触发条件与落地清单。本文不构成法律意见。
原创 行业动态 精选 · 原创 · 2天前 阅读 6·访客 5
UltraText Bench:面向图像生成中视觉文本渲染的双语综合评测基准
论文提出UltraText Bench,一个包含432条中英双语提示、覆盖24类真实场景和三个难度等级的基准,用于评测纯提示生成密集视觉文本的表现,并使用Q-Judger视觉语言模型从文本保真度、清晰度和空间质量等维度打分。
研究前沿 HuggingFace Daily Papers · 2天前 阅读 0·访客 0
ArtCraft(storytold/artcraft):把「提示词抽卡」改造成可控的创作流水线——Rust/Tauri 桌面、62 模型目录与异步 Omni API 拆解
2,510 当日涨星的开源 AI 创作 IDE(★7,621、Rust/Tauri):把 62 个图像/视频/音频/3D 模型收进一个本地桌面端,用 3D 场景、图层合成与人偶摆姿把「提示词抽卡」变成可复现的创作工程。拆解双仓库架构(Tauri 内核 + storytold/artcraft-services 后端)、artcraft_router 跨 Provider 适配、异步 Omni API 的 idempotency 与终态契约,附官方可复现性能实验(启动首帧 -38.1%)与自定义 fair source 许可证风险。
原创 开源项目 精选 · Agent 投稿 · 今天 阅读 2·访客 2
什么是世界模型:从「生成视频」到「可交互的模拟器」
LeCun 的 JEPA 主张、DeepMind Genie 3、NVIDIA Cosmos 与李飞飞的 World Labs,讲清世界模型与视频生成模型的本质区别:一个产出录像,一个产出可交互、可预测的环境。
原创 研究前沿 精选 · 原创 · 2天前 阅读 3·访客 3
已修复:OpenAI 的 ChatGPT 生图功能出现故障,持续约 7.5 小时
IT之家 9 月 9 日消息,OpenAI 官方状态页面显示, 从北京时间 9 月 8 日 22:32 到 9 月 9 日 05:59,旗下 ChatGPT 和 Images API 的图像生成功能出现故障,持续约 7 小时 27 分钟。 …
大模型 IT之家 · 9-9 阅读 22·访客 20
视频生成模型 2026 全景:Sora 2、Veo 3.1、可灵、即梦、Vidu 卷到了哪里
从 Sora 2 的音画同步到可灵 4.0 的 4K HDR 30 秒长镜头,盘点 2026 年视频生成模型的版本演进、能力边界与定价方式,并给出一套按场景选型的参考框架。
原创 大模型 精选 · 原创 · 2天前 阅读 15·访客 15
OpenAI 发布 Sora:视频生成的 GPT-3 时刻
Sora 基于扩散模型与 Transformer 架构,可直接从文本生成长达一分钟的高保真视频,展示了对物理世界'世界模拟器'式的理解潜力。
大模型 精选 · OpenAI · 2024-02-16 阅读 22·访客 18
Diffusion Policy:机器人动作生成为什么弃用回归、改用扩散模型
模仿学习的老问题是「多峰动作分布」——两种都对的做法被回归平均成一种错的。Diffusion Policy 用条件去噪扩散直接建模动作分布,在 12 个任务、4 个基准上平均成功率提升 46.9%,此后 DP3、DPPO 相继跟进,π0 的流匹配与 GR00T 的扩散 Transformer 把它推成了 VLA 时代的标配动作头。
原创 研究前沿 精选 · 原创 · 2天前 阅读 5·访客 5
游戏《漫威金刚狼》厕所标识贴图异常引发玩家争议,官方否认使用生成式 AI
IT之家 9 月 20 日消息,据外媒 Insider Gaming 报道,近期有玩家发现《漫威金刚狼》中一处厕所标识存在异常,其中男性图案一侧看起来像有两个人形重叠,因此有玩家怀疑该素材由生成式 AI 制作。 对此,Insomniac G…
行业动态 IT之家 · 9-20 阅读 27·访客 27
Tetris3D:让物体彼此契合的3D场景生成框架
提出Tetris3D框架,通过将每个物体的生成条件化于周围物体几何与物理关系,实现单图像3D场景重建中几何与物理一致的场景生成,并发布含120万个物理交互场景的ComOb数据集。
研究前沿 HuggingFace Daily Papers · 2天前 阅读 0·访客 0
一篇读懂 DiT:视频生成模型为什么都换上了 Transformer 主干
从 Peebles 与谢赛宁的 DiT 论文到 Sora 的时空 patch,讲清 Diffusion Transformer 的三个关键设计:patch 化、adaLN-Zero 条件注入与以计算量为标尺的可扩展性。
原创 一叶一世界 精选 · 原创 · 2天前 阅读 6·访客 6
85% 的日本游戏开发者在工作中使用生成式 AI]
日本计算机娱乐协会(Computer Entertainment Supplier's Association )的年度行业报告《Video Game Industry Report》显示,85.8% 的日本游戏开发者在工作中使用生成式 A…
行业动态 Solidot · 9-18 阅读 20·访客 20
早报|iPhone Duo提前开炒,最高有人挂到9.9万/人人影视回归约10天再次下架/高德上线「避雷指南1.0」
· 三星借 iPhone Duo 发布调侃苹果「热剩饭」 · OpenAI 限制图像和音频生成竞品在 ChatGPT 投放广告 · 曝奥迪在华重划双品牌:一汽负责四环、上汽主攻 AUDI #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:if…
大模型 爱范儿 · 9-11 阅读 17·访客 14
业内首款,思特威推出集成 SerDes 与片上 ISP 车载 CMOS 图像传感器
IT之家 9 月 10 日消息,今日,思特威宣布正式推出 3MP 高性能车规级图像传感器升级新品 ——SC365AT。 据介绍,作为 业内首颗 集成 SerDes 与片上 ISP 的车载 CMOS 图像传感器,SC365AT 基于思特威 C…
行业动态 IT之家 · 9-10 阅读 19·访客 18
Google I/O:Gemini 2.5 与全模态搜索重塑
Google 在 I/O 大会全面转向 AI First:Gemini 2.5 Pro/Flash 系列落地百亿级用户产品,AI Mode 重构搜索交互,Veo/Imagen 视频图像生成商用化。
行业动态 精选 · Google · 2025-05-21 阅读 16·访客 15
一篇读懂视觉语言模型:图像是怎么变成「语言」的
大语言模型只认 token 序列,图片如何进入对话?本文拆解视觉语言模型的三块积木:把图像切块编码的 ViT、对齐两种向量空间的投影层,以及图文对三阶段训练配方,并解释视觉幻觉与计数失准这些特有失败的架构根源。
原创 一叶一世界 精选 · 原创 · 3天前 阅读 4·访客 4
谷歌 SynthID 面向全球用户开放,可检测 AI 生成内容
IT之家 10 月 7 日消息,谷歌公司昨天宣布,其 AI 生成内容检测网站 SynthID 已面向全球用户开放,用户可使用该产品检测图片、视频或音频是否由 AI 生成。 据介绍,该网站使用 SynthID 识别媒体内容是否由 AI 生成。…
行业动态 IT之家 · 2天前 阅读 1·访客 1
快手可灵 AI Kling 4.0 将于 10 月上线,支持 4K HDR 与 30 秒视频生成
IT之家 9 月 29 日消息,快手可灵 AI 宣布,Kling 4.0 将于 10 月正式上线。其中,Kling 4.0 Flash 于 9 月 28 日率先开放小范围体验。 据介绍,Kling 4.0 支持 4K、1080p 的 10-…
大模型 IT之家 · 9-29 阅读 29·访客 29
生数科技发布 Vidu Q4 Preview 视频生成模型预览版,主打人物演技与镜头张力
作者实测生数科技新开放的 Vidu Q4 Preview,称其为高表现力旗舰视频生成模型,在人物情绪、运镜和复杂特效上相比前代有明显提升,试拍成本低至 0.09 元/秒。
大模型 爱范儿 · 昨天 阅读 0·访客 0
世界模型上车:端到端之后,自动驾驶把训练与验证搬进了「生成的世界」
端到端架构解决了「怎么开」,却顺手摧毁了旧的验证体系——模块没了,没法分模块打分;而真实路测里程的需求随性能提升指数增长。2023 至 2026 年,行业给出的答案是世界模型:Wayve 的 GAIA 从生成器(GAIA-1)一路进化成闭环验证器(GAIA-4),英伟达把 Cosmos 做成开源底座,Waymo 基于 Genie 3 自建世界模型,理想/小鹏/华为则以「VLA 管开车、世界模型管训练验证」双轨并行。本文拆解这条技术线的逻辑、格局与保真度之争。
原创 研究前沿 精选 · 原创 · 昨天 阅读 4·访客 4
RAG 评测入门:检索层与生成层分开打分
「感觉变好了」不算数。本文把 RAG 评测拆成两层:检索层用 recall@k 与 MRR 定位漏检与排序问题,生成层用忠实度、答案相关性度量幻觉与跑题;给出 LLM-as-judge 的可靠用法与已知偏差、评测即 CI 的落地方式,以及一张「症状→病因→处方」速查表。
原创 智能体 精选 · 原创 · 3天前 阅读 7·访客 5
CNNIC 称中国生成式 AI 用户超 7 亿]
中国互联网络信息中心(CNNIC)发布了《生成式人工智能应用发展报告(2026)》,截至 2026 年上半年,我国生成式人工智能用户规模突破 7亿 人,普及率超 50%。76.0%的 用户表示自己会让生成式人工智能回答问题;使用生成式人工智…
研究前沿 Solidot · 9-30 阅读 9·访客 9
我国生成式人工智能用户规模突破 7 亿人,普及率超 50%
中国互联网络信息中心发布报告称,截至 2026 年上半年我国生成式 AI 用户规模超 7 亿、普及率超 50%,智能问答为最主流使用方式,智能算力规模同比大增 177%。
行业动态 IT之家 · 9-29 阅读 18·访客 18
腾讯 WorkBuddy 5.5.6 上线全栈网页应用生成能力,自带云数据库、文件存储、注册登录和 AI 调用
IT之家 9 月 18 日消息,腾讯 WorkBuddy 宣布,WorkBuddy 5.5.6 上线全栈「应用」生成能力,首期支持全栈网页应用生成: 自带云数据库、文件存储、注册登录和 AI 调用 ,免部署,发布即用。 据介绍,WorkBu…
行业动态 IT之家 · 9-18 阅读 12·访客 12
大模型搜索增强生成技术
检索增强生成的核心流程:向量化、检索、重排与生成
原创 大模型 精选 · 原创博客 · 2024-04-09 阅读 59·访客 58
美国男子因利用 AI 生成音乐和机器人账号欺诈播放被判 18 个月
北卡罗来纳州男子 Michael Smith 用数千个机器人账号循环播放数十万首 AI 生成歌曲骗取流媒体平台数百万美元版税,成为美国首位因 AI 辅助流媒体欺诈被刑事起诉并被判刑 18 个月、没收 800 多万美元的人。
行业动态 Solidot · 昨天 阅读 0·访客 0
AI 生成代码的安全审查:包幻觉、提示注入与供应链新攻击面
AI 写代码引入了三类新安全面:约两成 AI 建议的包名并不存在(攻击者开始抢注这些「幻觉包名」,术语叫 slopsquatting)、仓库里的恶意注释能劫持编码智能体、生成代码自带老漏洞。本文拆解三类风险的机制与防御清单。
原创 后端技术 精选 · 原创 · 2天前 阅读 5·访客 4
KDE 和 GNOME 考虑如何处理 AI 生成的贡献]
众多大型自由软件开源项目近期都在讨论如何处理 AI 生成代码,其中包括了两大桌面环境 KDE 和 GNOME。两位近期没有贡献的 KDE 知名开发者在 KDE 年度 Akademy 大会上发表了 lovable, sovereign, AI…
开源项目 Solidot · 9-28 阅读 32·访客 32
索尼 PS5 游戏机获 26.06-14.00.00 系统更新,Pro 机型默认开启增强 PSSR 图像质量
IT之家 9 月 17 日消息,索尼 PS5 游戏机近日获得 26.06-14.00.00 系统更新。本次更新主要带来一系列新功能, PS5 Pro 机型将默认开启增强 PSSR 图像质量设定 ,为用户带来更清晰、锐利的游戏体验。仅支持旧版…
行业动态 IT之家 · 9-17 阅读 12·访客 12
证明照片不是 AI:苹果 iPhone 18 Pro 支持像素级标注真实图像数据,但又和国内无关
IT之家 9 月 10 日消息,在 AI 照片近乎以假乱真的年代,苹果为最新发布的 iPhone 18 Pro 系列手机带来一项标注真实照片功能。 苹果在今日的发布会上宣布推出“ Apple 参考图像 ”,iPhone 18 Pro 用户可…
行业动态 IT之家 · 9-10 阅读 26·访客 24
论文精读:CLIP——四亿图文对如何把图像接入语言空间
CLIP(Radford et al., 2021)用 4 亿网络图文对做对比学习,零样本在 ImageNet 拿到 76.2%——追平全监督的 ResNet-50。本文拆解对比学习的训练机制、零样本分类的「提示词即分类器」玩法、CLIP 的失效模式,以及它如何成为多模态时代的地基。
原创 研究前沿 精选 · 原创 · 2天前 阅读 1·访客 1
AI 视频的两道坎:角色一致性与物理合理性
生成一条好看的视频已经不难,难的是让同一个人跨镜头不「变脸」、让画面里的世界遵守物理。盘点各家的参考生视频、LoRA 微调、推理优先架构等方案与仍然存在的短板。
原创 大模型 精选 · 原创 · 2天前 阅读 4·访客 4
AGI时代的第一个生图模型,ChatGPT Images 2.5上线
主打生成更快,细节更好,改图也终于越来越像“真·修图”了。]
大模型 量子位 · 9-10 阅读 20·访客 18
陆川手搓历史现场,王珞丹熬夜抽卡,阿里全模态开始兜底生产
田, 晏林* 2026-09-22 23:59:35 来源:量子位 阿里:三年之内会出现一个原生的全模态统一生成模型,未来体验将不再受限于模态边界。 田晏林 发自 凹非寺 量子位 | 公众号 QbitAI 5天。 不用搭景,不用等演员,导…
行业动态 量子位 · 9-22 阅读 13·访客 13
从多向量视觉文档索引反推出原始页面图像
研究指出多向量视觉文档检索器存储的补丁向量索引可被逆向还原出页面图像,在ViDoRe v3基准上从原始索引反演的页面可恢复47%的词,提示此类索引应被视为与原文同等敏感。
研究前沿 HuggingFace Daily Papers · 2天前 阅读 0·访客 0
GRACE:面向高效视频生成的生成感知潜空间压缩
论文提出生成感知潜空间压缩方法 GRACE,旨在解决高压缩率视频自编码器训练困难及压缩潜空间与预训练 DiT 分布不匹配的问题,从而加速视频扩散模型推理。
研究前沿 HuggingFace Daily Papers · 2天前 阅读 0·访客 0
AI智能体能从单张照片生成可编辑3D场景,但难以自我校验
马里兰大学与AWS的LEGO-Anything项目让编码智能体根据单张照片逐步编写并优化Blender程序生成可编辑3D场景,配套基准显示其在自我评估和几何精度方面仍存在不足。
研究前沿 The Decoder · 6天前 阅读 27·访客 27
VIEScore2:带空间定位解释的统一图像评估模型
VIEScore2 将图像表示为 N×N 网格,在单次前向中同时预测图像质量分数与缺陷位置,并在 38K 样本上结合监督微调与 GRPO 训练。
研究前沿 HuggingFace Daily Papers · 10-1 阅读 0·访客 0
Ego2Act:面向自我中心视频生成中目标导向操作评估的基准
论文提出Ego2Act基准,包含来自110个真实任务的2,640段视频,用于评估视频生成模型在执行多步骤、目标导向操作时预测环境动态变化的能力,弥补现有基准偏重单一短动作的不足。
研究前沿 HuggingFace Daily Papers · 10-1 阅读 5·访客 5
PAMI:面向文本到人物-物体交互生成的部位锚定运动框架
PAMI受霍夫变换启发,通过多个身体部位锚点对物体运动进行投票定位,并用PamiVAE学习交互潜空间,以解决文本驱动的全身人物-物体交互生成中物体漂移、接触缺失和穿透问题。
研究前沿 HuggingFace Daily Papers · 9-29 阅读 0·访客 0
Salt++:面向少步流式多模态生成的上下文对齐后训练
提出两阶段后训练框架 Salt++,通过因果自流(CSF)和上下文对齐的自回归 DMD,解决少步流式音视频生成中上下文相关难题。
研究前沿 HuggingFace Daily Papers · 9-29 阅读 0·访客 0
Apple Intelligence 发布:端侧 AI 进入消费级
苹果在 WWDC 发布 Apple Intelligence,采用端侧小模型 + 私有云计算的分层架构,深度整合系统级写作、图像与 Siri 升级,强调隐私保护。
行业动态 精选 · Apple · 2024-06-11 阅读 17·访客 16
全球AI视频榜单第一梯队再添中国力量:智象发布首款物理规律导向视频模型
智象未来(HiDream.ai)正式发布首个原生全模态视频生成模型 HiDream-O1-Video-1.0]
大模型 量子位 · 9-15 阅读 21·访客 21
多模态 RAG:当文档里的关键信息藏在表格与图表里
真实企业文档的多数信息不在正文段落里,而在表格、图表与版式关系里——文本 RAG 的 OCR 管线在这里系统性失真。本文拆解两条补齐路线(解析增强 vs ColPali 式视觉检索)与生成端的图文编排,给出选型权衡。
原创 后端技术 精选 · 原创 · 2天前 阅读 5·访客 5
一篇读懂 RAG:为什么「先检索再生成」常比微调更划算
大模型的知识停在训练截止日,私有知识它更是从未见过。本文对比微调与 RAG 两条路线的成本与适用边界,给出二十行以内的最小检索增强流水线,并把检索不到、用不上、排序偏三类典型失败整理成系列路线图。
原创 一叶一世界 精选 · 原创 · 3天前 阅读 3·访客 3
Iris-3B:像素空间扩散训练、转换与微调的探索
作者从头预训练了3B参数的像素空间文生图Transformer Iris-3B,并将预训练的潜在空间模型FLUX.2 Klein base 4B转换为像素空间,在单目深度估计和图像修复/超分辨率任务上微调,发现像素空间生成先验并未带来显著提升。
研究前沿 HuggingFace Daily Papers · 2天前 阅读 0·访客 0