IA Traitement du son · 31 August 2026Fish Audio, 52 M$ en seed : la voix IA qui défie ElevenLabs et s’ancre dans l’ère des NPU
Le 28 juillet 2026, une startup discrète, née d’un hobby sur une carte graphique NVIDIA RTX 4090, annonce une levée de fonds seed de 52 millions de dollars – un montant qui dépasse de loin les tours de table de ses concurrents au même stade. Fish Audio revendique 8 millions d’utilisateurs, 21 millions de dollars de revenus annuels récurrents et une technologie de synthèse vocale multilingue capable de contrôler l’émotion mot par mot. Un mois plus tard, alors que l’écosystème audio IA bascule vers le traitement local sur NPU et que des modèles unifiés comme SwanTale de ByteDance émergent, la question n’est plus seulement « qui a le meilleur TTS ? » mais « qui dominera la prochaine génération d’infrastructure vocale ? » Plongée dans le phénomène qui bouscule l’industrie de la voix IA.
52 millions de dollars en seed : le signal d’alarme qui réveille l’industrie de la voix IA
Le 28 juillet 2026, l’écosystème de l’audio IA a sursauté. Fish Audio, une jeune pousse basée à Palo Alto, a officialisé une levée de fonds seed de 52 millions de dollars – certains titres de presse ont arrondi à 50 millions, mais le blog officiel et le communiqué PRNewswire confirment le montant exact de 52 M$. Ce tour de table, mené par Coreline Ventures et Capital Today, avec la participation de 359 Capital, Play Time, HF0, 645 Ventures, Parable, Carya Venture Partners, Alphalist Partners et Bayhouse Ventures, est l’un des plus importants jamais réalisés en seed dans le domaine de la voix synthétique.
Pour comprendre l’ampleur du signal, il faut le replacer dans le contexte de 2026. La synthèse vocale par IA n’est plus une curiosité de laboratoire : elle alimente des millions de podcasts, de doublages vidéo, d’assistants vocaux et de jeux vidéo. Des acteurs comme ElevenLabs, Respeecher ou Amazon Polly se disputent le marché, mais aucun n’avait levé une telle somme à un stade aussi précoce. Fish Audio, en un seul tour, s’est hissé au rang de prétendant sérieux au trône.
Mais ce montant record soulève aussi une question : s’agit-il d’un pari sur une technologie réellement disruptive, ou d’une bulle spéculative dans un secteur en pleine effervescence ? Pour y répondre, il faut remonter aux origines du projet.
De la carte graphique 4090 au tour de table record : la genèse de Fish Audio
L’histoire de Fish Audio commence modestement, presque comme un jeu. Shijia Liao, ancien chercheur vidéo chez NVIDIA et grand fan de VTuber et d’anime, a commencé à expérimenter la synthèse vocale sur une seule carte graphique NVIDIA RTX 4090 dans sa chambre. « C’était un hobby », raconte Rissa Cao, la CEO, dans l’interview accordée à TechCrunch. « Nous voulions voir si on pouvait cloner une voix avec un temps d’entraînement ridiculement court. » L’objectif initial : donner vie aux voix de ses VTuber préférés, qu’il trouvait désespérément monotones.
Le projet a rapidement dépassé le cadre du passe-temps. En un an, l’équipe est passée de 3 à 22 personnes, et le dépôt GitHub Fish Speech a accumulé plus de 31 000 étoiles, devenant l’un des référentiels open source les plus populaires pour la génération vocale. Cette communauté a servi de rampe de lancement : les retours des développeurs ont permis d’affiner les modèles, et la notoriété a attiré l’attention des investisseurs.
Le passage du hobby à l’entreprise s’est fait sans précipitation. Fish Audio a d’abord lancé des modèles open source (trois modèles TTS), puis un modèle payant, S2.1 Pro, et enfin un modèle de reconnaissance vocale (STT). En tout, 5 modèles audio expédiés en un an : quatre text-to-speech et un speech-to-text. La startup a su capitaliser sur la vague open source tout en construisant une offre commerciale – une stratégie hybride qui a séduit les fonds.
Dual autoregressive, 83 langues et contrôle émotionnel : décryptage de la technologie propriétaire
Fish Audio communique peu sur l’architecture précise de ses modèles. Le blog officiel évoque un modèle « dual autoregressive » – une architecture sur laquelle Shijia Liao aurait fait un pari précoce, « que le reste de l’industrie ne rattraperait pas avant deux ans ». On ignore s’il s’agit d’une variante de transformer, d’un modèle de diffusion, ou d’une approche inspirée de VALL-E ou Voicebox. Cette opacité est frustrante pour les experts, mais elle n’est pas rare dans un secteur où la propriété intellectuelle est un avantage concurrentiel.
Ce que l’on sait, c’est que le modèle S2.1 Pro revendique des capacités impressionnantes :
| Capacité | Chiffre annoncé |
|---|---|
| Langues supportées | 83+ (avec cadence native) |
| Contrôle émotionnel | 15 000+ contrôles de langage naturel (mot par mot) |
| Modèles vocaux dans la bibliothèque communautaire | 2 millions+ |
| Préférence en test à l’aveugle (S2.1 Pro vs concurrents) | 66 % des auditeurs |
| Temps de clonage | ~5 secondes d’audio, ~15 secondes de traitement |
| Latence temps réel | Sub-90 ms (revendication constructeur) |
Le contrôle émotionnel au niveau du mot est l’innovation la plus frappante. Là où la plupart des systèmes permettent de choisir une émotion globale (joyeux, triste, en colère), Fish Audio affirme pouvoir moduler l’intonation, le rythme et le timbre à l’échelle de chaque mot. Concrètement, une phrase comme « Je ne suis pas fâché, mais… » pourrait voir le mot « fâché » prononcé avec une légère tension, tandis que « mais » glisse vers une nuance d’excuse. Le produit narrative évoque des tags comme [whispers] ou [laughing nervously] insérés directement dans le texte. C’est un niveau de granularité qui rapproche la voix synthétique de l’expressivité humaine.
Cependant, aucun benchmark indépendant (MOS, latence, intelligibilité) n’est fourni. Les 66 % de préférence en test à l’aveugle sont auto-déclarés, sans détail méthodologique – certains articles citent même ~67 %, une variation qui illustre le flou qui entoure ces chiffres. La prudence reste de mise.
21 millions de dollars de revenus, 8 millions d’utilisateurs : les chiffres qui font trembler ElevenLabs
Les métriques avancées par Fish Audio donnent le vertige :

| Métrique | Valeur |
|---|---|
| Revenus annuels récurrents (ARR) | 21 M$ |
| Utilisateurs (créateurs, développeurs, entreprises) | 8 millions+ |
| Modèles vocaux dans la bibliothèque communautaire | 2 millions+ |
| Modèles expédiés en un an | 5 (4 TTS, 1 STT) |
| Équipe | 22 personnes |
Pour mettre ces chiffres en perspective, rappelons qu’ElevenLabs revendiquait environ 1 million d’utilisateurs en 2023 et des revenus estimés à 20 millions de dollars à la même époque (chiffres non sourcés dans notre base, mais couramment cités). Fish Audio, avec 8 millions d’utilisateurs et 21 M$ d’ARR, semble avoir rattrapé – voire dépassé – son rival en termes de base installée.
Mais attention : ces chiffres sont auto-déclarés. Aucun auditeur indépendant n’a vérifié le nombre d’utilisateurs actifs, le taux de conversion ou la répartition entre comptes gratuits et payants. La croissance fulgurante pourrait être portée par une adoption massive de l’offre gratuite, sans garantie de monétisation durable. ElevenLabs, de son côté, a levé des fonds à des valorisations plus élevées et dispose d’une reconnaissance de marque plus forte.
Face aux géants et aux alternatives open source : où se situe vraiment Fish Audio ?
Le paysage de la synthèse vocale en 2026 est fragmenté. D’un côté, les géants du cloud (Amazon Polly, Google TTS, Microsoft Azure) proposent des solutions robustes mais génériques. De l’autre, des spécialistes comme ElevenLabs, Respeecher ou Cartesia misent sur la qualité et l’expressivité. Enfin, l’open source offre des alternatives comme Bark (Suno), Coqui TTS ou Tortoise-TTS, souvent moins polies mais gratuites.
Fish Audio se positionne à l’intersection de ces mondes. Son modèle open source (Fish Speech) attire les développeurs et alimente la communauté ; son modèle payant (S2.1 Pro) cible les professionnels. La startup met en avant trois avantages :
- Vitesse de clonage : environ 5 secondes d’audio suffisent pour cloner une voix, avec un traitement en ~15 secondes (chiffres communiqués par PRNewswire).
- Prix : selon l’analyse d’Explainx, Fish Audio se positionne à environ 1/6 du coût d’ElevenLabs, avec une promesse commerciale agressive : « 50 % moins cher ou une année gratuite ».
- Multilinguisme natif : 83 langues avec cadence naturelle, là où beaucoup de concurrents peinent à dépasser 30 langues.
Mais des lacunes subsistent. Aucune donnée indépendante sur la latence (temps de génération) n’est fournie – la revendication sub-90 ms reste un chiffre constructeur. Les plans tarifaires ne sont pas détaillés publiquement. Et surtout, aucun benchmark indépendant ne compare Fish Audio à ElevenLabs, Respeecher ou Google TTS sur des critères objectifs comme le MOS (Mean Opinion Score) ou l’intelligibilité dans le bruit.
| Critère | Fish Audio (auto-déclaré) | ElevenLabs (estimations) |
|---|---|---|
| Langues | 83+ | ~30 (2023) |
| Contrôle émotionnel | Mot par mot (15 000+ contrôles) | Global (quelques émotions) |
| Utilisateurs | 8 M | ~1 M (2023) |
| ARR | 21 M$ | ~20 M$ (estimé 2023) |
| Open source | Oui (Fish Speech, 31k stars) | Non |
De HeyGen à Sanas : les applications concrètes qui séduisent les entreprises
Fish Audio ne se contente pas de séduire les développeurs isolés. Selon TechCrunch et l’analyse d’Explainx, la startup compte parmi ses clients HeyGen (créateur d’avatars IA), LiveKit (infrastructure pour agents vocaux), Retell (agents téléphoniques), Sanas (plateforme de voix pour le support client) et OpenArt (création artistique IA). Ces noms dessinent un portefeuille d’applications variées :

- Doublage vidéo : HeyGen utilise Fish Audio pour synchroniser la voix des avatars avec les mouvements labiaux, dans plusieurs langues.
- Jeux vidéo : un studio non nommé aurait intégré le modèle pour générer les voix de personnages non-joueurs (PNJ) en temps réel.
- Agents vocaux : LiveKit exploite Fish Audio pour des assistants téléphoniques capables de moduler leur ton selon le contexte – la latence est le produit.
- Support client : Sanas et d’autres entreprises automatisent les appels de vente et de service après-vente, où le coût à la minute domine les marges.
- Création artistique : OpenArt utilise la voix IA pour des projets créatifs.
Le blog officiel mentionne également des cas d’usage communautaires : des fans d’anime doublant des personnages, des développeurs de jeux indépendants, et des créateurs de contenu sur YouTube/TikTok. Mais aucun partenariat formel avec des studios de cinéma ou des plateformes de streaming n’est évoqué.
La controverse du consentement vocal : quand la croissance fulgurante heurte l’éthique
Toute médaille a son revers. TechCrunch rapporte que des créateurs ont allégué que leurs voix avaient été téléchargées sur Fish Audio sans leur consentement. La plateforme, qui héberge plus de 2 millions de modèles vocaux dans sa bibliothèque communautaire, aurait servi de dépôt pour des voix clonées sans autorisation.
Face à ces accusations, Fish Audio a mis en place un processus automatisé de retrait DMCA. La CEO Rissa Cao a déclaré que l’entreprise prenait ces préoccupations « très au sérieux » et travaillait à améliorer la modération. Mais la tension entre ouverture (bibliothèque communautaire) et protection des droits est inhérente au modèle économique de Fish Audio. Plus la base de modèles vocaux est grande, plus l’outil est utile – mais plus le risque d’abus est élevé.
En 2026, le cadre réglementaire se durcit. L’Union européenne a adopté l’AI Act, qui classe le clonage vocal non consenti comme une pratique à haut risque. Aux États-Unis, plusieurs États ont introduit des lois sur les deepfakes vocaux. Fish Audio devra naviguer dans ces eaux troubles tout en maintenant sa croissance.
L’ère des NPU et du traitement local : Fish Audio face à la bascule edge
Si Fish Audio a bâti sa croissance sur le cloud et l’open source, l’industrie audio IA vit en 2026 une mutation profonde : le traitement local sur NPU (Neural Processing Unit) s’impose comme le nouveau champ de bataille. Les processeurs modernes – AMD Ryzen AI 400 avec son NPU XDNA 2 (55-60 TOPS, latence de réduction de bruit < 2 ms), Apple M4/M5 avec Neural Engine (38 TOPS, < 5 ms), Intel et Qualcomm – intègrent désormais des capacités d’inférence audio en temps réel, sans envoi de données au cloud.
Cette bascule a des implications directes pour Fish Audio. Son modèle open-weight Fish Speech, une fois téléchargé, peut déjà fonctionner localement – une caractéristique que TechCrunch a soulignée comme un avantage et un risque : les créateurs peuvent exécuter le modèle sans passer par la plateforme, ce qui rend les retraits DMCA inefficaces contre les copies déjà diffusées. Mais c’est aussi une opportunité : alors que les DAW et plugins s’adaptent aux NPU (comme le montre l’intégration native de fonctionnalités IA dans Ableton Live et Logic Pro en 2026), Fish Audio pourrait proposer des versions optimisées pour l’inférence locale, avec une latence encore plus faible et une confidentialité totale.
Les chiffres parlent d’eux-mêmes : la réduction de bruit par NPU atteint des gains SNR de +42 à +48 dB sur AMD Ryzen AI 400, et +28 à +42 dB sur Apple M4/M5, avec des latences inférieures à 5 ms. Pour un acteur comme Fish Audio, dont la promesse est la latence sub-90 ms, l’exécution sur NPU pourrait réduire ce chiffre à quelques millisecondes, rendant les agents vocaux réellement conversationnels. Le marché des AI PC représentait déjà 43 % des parts de laptop mondiales en mars 2026 – un terreau fertile pour des modèles vocaux embarqués.
SwanTale, Stable Audio 3.0, Sequoia 2026.5 : l’écosystème s’accélère
Fish Audio n’évolue pas dans le vide. En août 2026, plusieurs annonces ont redéfini le paysage :
- ByteDance SwanTale (4 août 2026) : un modèle unifié de 2B paramètres qui génère voix, effets sonores, musique et audio environnemental en une seule passe d’inférence, avec clonage vocal « Engram ». Il s’agit d’une architecture MoE (Mixture of Experts) qui unifie les modes instruction et zero-shot – une réponse directe à la spécialisation de Fish Audio.
- Stable Audio 3.0 (20 mai 2026) : Stability AI a lancé une famille de quatre modèles capables de générer des morceaux complets de 6 minutes 20 secondes, avec des tailles allant de 459M à 2.7B paramètres. La génération musicale longue durée devient une réalité.
- Boris FX Sequoia 2026.5 (6 août 2026) : un Spatial Panner unifié pour le mixage stéréo, surround et immersif (Dolby Atmos), illustrant l’industrialisation du spatial audio.
- Windows 11 KB5121003 (11 août 2026) : la mise à jour de Windows 11 25H2 apporte des améliorations audio et NPU, après l’introduction de Shared Audio et NPU Monitoring en juin 2026.
Ces évolutions montrent que la voix IA n’est plus un silo : elle s’intègre dans des workflows multimodaux, où la génération vocale, musicale et sonore converge. Fish Audio, avec son focus sur la voix expressive, devra soit se spécialiser davantage, soit élargir son offre pour rester pertinent face à des modèles unifiés comme SwanTale.
Que fera Fish Audio de ses 52 millions ? Les paris sur l’avenir de la voix synthétique
Avec 52 millions de dollars en banque, Fish Audio a les moyens de se diversifier. Plusieurs pistes se dessinent :
- Optimisation NPU : développer des versions de S2.1 Pro et Fish Speech capables de tourner sur les NPU des AI PC, avec une latence inférieure à 10 ms et une consommation en milliwatts. C’est le pari que font déjà des acteurs comme Syntiant ou Deepgram.
- Modèles unifiés : suivre la voie de SwanTale en intégrant la génération musicale et sonore à la voix, pour offrir une suite complète aux créateurs.
- Expansion entreprise : la CEO Rissa Cao a déclaré que les fonds serviront à financer « des modèles plus avancés et une poussée vers les comptes d’entreprise ». Les agents vocaux (support client, télémarketing) sont un marché en pleine explosion.
- Régulation et éthique : investir dans des outils de vérification de consentement et de provenance vocale, pour répondre aux exigences de l’AI Act et des lois étatiques américaines.
Le défi sera de maintenir la croissance sans sacrifier la confiance. Fish Audio a prouvé qu’une startup de 22 personnes pouvait rivaliser avec des géants – mais la route vers la domination est semée d’embûches réglementaires, techniques et concurrentielles. Une chose est sûre : la voix IA n’a jamais été aussi vivante, et Fish Audio en est l’un des fers de lance.
Sources
- Fish Audio – Site officiel
- Fish Audio obtient 52 M$ de financement – Unite.AI
- 5 modèles, 22 personnes, 1 an – Blog Fish Audio
- Fish Audio $52M Seed + S2.1 Pro TTS – Explainx
- Fish Audio Raises $52M Seed – Enterprise DNA
- Fish Audio Raises $52M in Seed Funding – Finsmes
- Fish Audio Raised $52M Seed on Voice Cloning – TechTimes
- ElevenLabs – Site officiel
- ByteDance SwanTale – AI Weekly
- ByteDance SwanTale – TechTimes
- Boris FX Sequoia 2026.5 – Sound On Sound
- Windows 11 KB5121003 – Pureinfotech
- NPU Noise Suppression Benchmarks – Digital Gamer Hub
- Étude : 40 % de la musique de juillet 2026 a utilisé l’IA – Euronews
Article recherché et rédigé automatiquement · Magazine Electrosens