一家成立仅一年的语音 AI 公司,22 人团队,2100 万美元年经常性收入(ARR),800 万用户——这些数字出现在种子轮融资公告中,本身就说明问题。
7 月 28 日,Palo Alto 的 Fish Audio(运营主体 Hanabi AI Inc.)宣布完成 5200 万美元种子轮融资,由 Coreline Ventures 和 Capital Today 联合领投,359 Capital、Play Time、HF0、645 Ventures、Parable、Carya Venture Partners、Alphalist Partners 及多位天使投资人跟投。这一数字刷新了 AI 语音赛道种子轮的纪录。
在 ElevenLabs 今年 2 月以 110 亿美元估值完成 5 亿美元 D 轮融资的赛道上,Fish Audio 用不同的路径拿下了不同的筹码:开源起步、社区驱动、22 人精干团队做到令种子阶段罕见的商业化指标。但同一套「用户上传声音→训练模型→商业化」的增长飞轮,也在过去几个月中将公司推到了 AI 语音版权争议的中心。
从一张 RTX 4090 到 8,000 token/s 推理栈
Fish Audio 的起点是首席科学家 Shijia Liao 在 NVIDIA 做视频研究期间的一个副业。作为 VTuber 和动漫粉丝,他对当时市面上合成语音的机械感感到不满,开始在卧室用一张 RTX 4090 训练语音模型。
Liao 做了一个关键的技术选择:采用 Dual Autoregressive(Dual-AR)架构——一个 4B 参数的 Slow AR 模型沿时间轴预测语义编码,一个 400M 参数的 Fast AR 模型在每个时间步生成剩余 9 个残差编码本,重建细颗粒度的声学细节。他在公司博客中写道,这个架构选择「领先了行业两年」。
到 2026 年 7 月,这套架构已经支撑了 S2.1 Pro 的生产部署:在单张 NVIDIA H200 上达到 8,000+ tokens/s 的吞吐量(64 并发),实时因子(RTF)0.195,首音频延迟约 100ms。在官方的盲测中,S2.1 Pro 的 Bradley-Terry 得分 3.07,以 66% 的偏好率超过了 ElevenLabs V3 和 Inworld 等对手。
推理效率的提升直接影响了商业模式。7 月 23 日,Fish Audio 宣布 S2.1 Pro API 向开发者免费开放。支撑这一决策的是自研的 fish-scales-ops CUDA 内核库——针对 TTS 推理中 M≤128 的小矩阵乘(decode shapes)做了 FP8 GEMM 和 FlashAttention 的深度优化,相比标准 cuBLAS 在 decode 场景提速 2.1-4.3 倍。加上 continuous batching 带来的 52 倍吞吐扩展(从 1 并发到 64 并发),同样的请求量从需要四张 H200 压到了一张。公司还自建了约 500 张卡的 GPU 集群、ASN 网络和 Ceph 存储,绕过了云厂商的算力和带宽加价。
「推理成本的断崖式下降,是免费 API 的经济前提,不是一场慈善。」Shijia Liao 在技术博客中写道。
开源的算盘:free for research,但不做慈善
Fish Audio 在 GitHub 上的 Fish Speech 仓库已获得 31,400+ stars,开源了三个语音生成模型的权重、微调代码、技术报告和生产级推理引擎(通过 SGLang-Omni)。这种开放程度在 TTS 领域少见——大多数商业语音平台连模型架构都不公开。
但「开源」在这里有其精确的含义。S2 采用 Fish Audio Research License:研究和非商业用途完全免费,商业部署需单独购买授权。公司 CEO Rissa Cao 在博客中坦承 S2 是「开放权重」而非 OSI 定义的「开源」,理由是「要在社区可及性和商业可持续性之间取得平衡」。
这个定位比看上去更务实。自建推理栈的成本优势、22 人的团队规模、以及 community-driven 带来的多语言和口音数据覆盖,让 Fish Audio 在理论上可以同时压价 ElevenLabs 等云托管竞品,又在技术上与没有专职团队维护的纯社区项目拉开距离。
商业端的数据验证了这个双轨策略。CEO Rissa Cao 在融资公告中透露,企业收入现在占公司总收入的三分之二。客户名单包括 AI 数字人公司 HeyGen、语音实时交互平台 LiveKit、呼叫中心降噪方案商 Sanas、AI 录音笔品牌 Plaud,以及 Retell、OpenArt、Telnyx 等。企业级部署支持本地化(on-premises)、零数据留存和 HIPAA 合规——这是大多数以创作者工具起家的语音平台尚未提供的配置。
200 万社区语音模型与版权未爆弹
Fish Audio 的增长飞轮有一个公开的秘密:平台上超过 200 万个语音模型,相当一部分来自用户自行上传的声音样本。公司鼓励用户贡献自己的声音用于训练,并在使用后给予补偿。这个机制帮助模型覆盖了 83 种语言的非主流口音和边缘场景——CEO 称之为「用户帮我们测试了我们永远不会想到的用例」。
问题出现在另一面。2026 年上半年,多名创作者指控自己的声音在未经授权的情况下被上传到 Fish Audio 平台。英国布里斯托尔的配音演员 Faye Dicker 向 BBC 表示,她在 Fish Audio 上发现了自己被克隆的声音,已被下载超过 900 次。Dicker 的声音样本被用于生成她从未录制的商业和创意内容,她称之为「难以置信」的侵犯。
今年 6 月,英国演员工会 Equity 公开致函 Fish Audio,要求立即移除平台上所有未经授权的克隆声音,并披露底层录音和相关生物识别数据的处理方式。Equity 在 Instagram 上的声明下面,声优们表达了大规模的担忧和愤怒。
Fish Audio 的反应是加速了机制建设而非原则改变。CEO Rissa Cao 告诉 TechCrunch,公司已将 DMCA 下架流程自动化:权利人可以提交一段短声音样本或合同证明声音归属,平台将在 3 分钟内完成移除。今年 7 月 4 日,公司发布了详细的声音所有权申诉指南,引入了实时语音验证功能。
但核心矛盾并未解决:Fish Audio 仍然不要求用户在上传声音前验证归属权。任何人仍然可以上传任何人的声音,这个声音在权利人发现并提交申诉之前,将继续在平台上被使用和下载。领投方 Coreline Ventures 的合伙人 Osuke Honda 也承认了这个问题的严重性:「社区驱动模式只有在创作者信任平台时才能成为持久优势。同意、透明和归因必须被内建到产品中,而不是事后补救。」他在 TechCrunch 的采访中提到,行业需要走向「验证声音所有权、清晰的许可条款、简便的报告和下架流程,以及最终的收益分享机制」。
这不是 Fish Audio 一家的困境。ElevenLabs、Speechify、Murf 等平台面临同样的压力。2024-2026 年间,加州、田纳西州和欧盟相继通过立法,将个人声音视为受保护的人格权或财产权。美国的联邦级 NO FAKES 法案正在审议中。当前的法律框架中,DMCA 只覆盖版权侵权——即使用了你的实际录音——而非「听起来像你」的模仿。对大多数声优来说,这意味着一项技术上可行的侵权行为,法律上却缺乏有效的快速救济工具。
大市场中的小公司:语音 AI 的下一步
Fish Audio 在种子轮拿到的 5200 万美元在 AI 行业不算大数——ElevenLabs 今年 2 月的 D 轮是 5 亿美元。但 2100 万美元 ARR 和 800 万用户让这轮融资有了说服力。在 22 人的团队规模下,人效约 95 万美元,对于一个成立一年的初创公司来说,这个指标在 SaaS 领域都算出色。
第三方市场数据为这条赛道提供了宏观背景。MarketIntelo 估计全球语音 AI 平台市场 2025 年约 52 亿美元,2034 年可达 486 亿美元,年复合增长率 28.6%。增长动力来自 LLM 驱动的对话式 AI、实时语音交互和 AI Agent 对自然语音接口的刚性需求。
Fish Audio 的路线图指向了 TTS 之外的产品。公司在融资公告中确认,年内将发布一个 Audio Understanding Language Model(语音理解大模型)和一个 speech-to-speech 模型——后者是实现端到端语音交互(输入语音、输出语音,中间不经过文本)的关键组件。这将是与 ElevenLabs 的 ElevenAgents 和 OpenAI 的 GPT-Realtime-2 直接竞争的方向。
359 Capital 合伙人 Rico Mallozzi 在 TechCrunch 采访中表示,Fish Audio「用比那些资金充裕得多的 AI 实验室更小的团队实现了最先进的模型,这证明了他们在缩小人工感与自然声音之间差距方面的技术能力」。
Faye Dicker 的声音仍然可能被重新上传到平台。Fish Audio 的自动化下架流程可以快速移除,但不能阻止。这是一个技术可以解决的问题——比如上传时要求实时语音验证——但验证机制会在社区飞轮的转速上增加摩擦。
这也是 Fish Audio 下一步面临的核心选择:是继续最大化社区驱动的增长引擎,还是因为版权问题放慢脚步、建立一个事先验证的声音所有权体系。5200 万美元的种子轮给了公司做这个选择的空间——但选择的方向,会影响整个 AI 语音行业在未来几年的版权实践标准。

