发生了什么
9月4日,谷歌正式将旗下最强音乐生成模型Lyria 3.5上线至Gemini应用和Gemini API,面向全球所有用户开放,网页端和移动端同步上线。此前该模型仅在Google Flow Music中面向专业创作者提供。
核心升级
Lyria 3.5的核心升级集中在四个方面:音乐性方面,模型能构建更复杂的旋律结构,在整首曲目中自然发展而非陷入重复;人声方面,生成的人声更具表现力和情感层次,发音更清晰;歌词方面,对提示词的遵循度更高,能识别歌曲结构标记;时长方面,支持从60秒片段到最长3分钟的完整歌曲。
使用方式
在Gemini应用中,用户可以选择或描述音乐流派,切换人声或纯器乐模式,使用内置模板快速生成背景音乐、品牌旋律或个性化铃声。开发者通过API可调用两个模型:lyria-3.5生成完整曲目,lyria-3-clip-preview生成固定30秒片段。
API支持高级功能:开发者可提供最多10张图片配合文本提示进行多模态生成,使用[Verse]、[Chorus]、[Bridge]等段落标签自定义歌词结构,甚至用时间戳指定特定时刻的乐器进入。输出为44.1kHz立体声音频,默认MP3格式,Lyria 3.5还支持WAV输出。
安全与版权
所有生成的音频均嵌入SynthID水印,人耳不可感知,但可被检测系统识别为AI生成内容。模型内置安全过滤,不支持模仿特定艺术家声音或生成受版权保护的歌词。
谷歌的分发策略值得关注:同一模型针对不同人群放在不同产品中——普通用户用Gemini,专业创作者用Flow Music,开发者用AI Studio,视频制作者用Google Vids。这一布局显示谷歌正将音乐生成从「玩具」推向「工具」。直接竞争对手包括Suno和Udio等专攻音乐生成的创业公司。

