AI 音乐的版权账:训练、产出与商用,三笔账各有各的算法
AI 音乐的版权问题不是一句话能答的:训练端有 GEMA 在德国赢下 Suno 的判决,产出端美国版权局坚持「纯 AI 生成不受保护」,商用端平台条款决定了你拿到的是什么权利。本文把三笔账分开算清,给创作者一份实操清单。本文不构成法律意见。
阅读全文 →
系列文章
ARCHIVE 共 8 条AI 音乐的版权账:训练、产出与商用,三笔账各有各的算法
AI 音乐的版权问题不是一句话能答的:训练端有 GEMA 在德国赢下 Suno 的判决,产出端美国版权局坚持「纯 AI 生成不受保护」,商用端平台条款决定了你拿到的是什么权利。本文把三笔账分开算清,给创作者一份实操清单。本文不构成法律意见。
音频理解:大模型怎么「听懂」ASR 之外的声音世界
转写成文字只是「听见」,音频理解的野心是「听懂」:环境声事件、音乐结构、说话人情绪、副语言信息。本文拆解音频语言模型的技术配方(音频编码器 → 语义 token → LLM)、开源代表 Qwen 系与评测基准 MMAU/AudioBench,以及它正在替代的旧管线。
AI 配音与播客工作流:从文稿到成品音频的工业化五段法
「把文稿变成能听的节目」已经是一条可工业化的流水线:声音资产管理、逐段生成与情绪控制、多角色编排、后期质检各有工具与坑。本文以 ElevenLabs 与开源自托管两条路线为轴,拆解 AI 配音的完整工作流与成本账。
一篇读懂语音克隆:几秒参考音频是怎么复刻一个人声音的
零样本语音克隆只需约 6 秒参考音频:说话人编码器把音色压成一个向量,再去条件化 TTS 生成——XTTS 一条路是「嵌入式克隆」,OpenVoice 一条路是「合成后换色」。本文拆解两条技术路线的原理、效果边界,以及这道技术必须面对的滥用与合规问题。
AI 音乐生成格局:Suno 与 Udio 从被告席走向授权时代
Suno v5 与 Udio 曾是 AI 音乐的双子星,2024 年被三大唱片起诉后走上不同道路:Udio 与环球和解、关闭下载建「围墙花园」,Suno 拿下华纳合作但仍被环球与索尼起诉。本文梳理截至 2026 年 10 月的产品格局与授权模式转型。
一篇读懂端侧语音助手链路:唤醒词、VAD、流式 ASR、TTS 与打断
「小爱同学」到回答只有两秒,中间站着五道流水线工位:唤醒词、VAD、流式 ASR、LLM、TTS,外加最难的一道暗桩——打断处理。本文按延迟账拆解每道工位的职责、模型选型与失败模式,算清为什么端侧语音助手的优化是一张接力棒时刻表。
语音链路地图:ASR、TTS 与实时对话的延迟账
语音对话「说完—听懂—想好—说出」四段链路各带百毫秒级延迟,叠加起来轻易超过人类对话的停顿预算。本文摊开全链路延迟账本,拆解 VAD、流式识别、首 token 与流式合成各环节,并对比级联与端到端两条架构路线。
VoiceStudio(debpalash/VoiceStudio):把 ElevenLabs 搬进本机的开源语音工作台
Palash Debnath 的全本地开源语音工作台 VoiceStudio(当日涨星 +3,274、★43,728、AGPL-3.0):把 17 个 TTS 与 7 个 ASR 引擎抽象成可插拔引擎层,覆盖克隆/设计/配音/听写/有声书并内置 MCP。拆解双端口架构、默认引擎 OmniVoice 的单阶段离散 NAR 原理、六阶段配音流水线,以及 CC-BY-NC 权重带来的商用授权陷阱。