Maison
Wanxiang Shengsheng dévoile un outil de livres audio par IA à faible coût, à moins de 8 yuans pour 10 000 caractères
Deux mois après sa bêta publique, Wanzhuang Yousheng a officiellement lancé son système de production automatisée, « Création entièrement automatique d’audiobooks multi-voix par IA », une fonctionnalité qui avait déjà conquis les titulaires de droits lors des essais internes.
Lancée par l’équipe centrale derrière Lazy Listen, cette plateforme de contenu audio par IA a achevé les tests publics de cette fonctionnalité stratégique en début juin. Au cœur du dispositif se trouve une combinaison de capacités éprouvées en IA — division intelligente des chapitres, analyse des personnages, génération de scripts, doublage multi-personnages et synthèse post-production — orchestrées par un moteur de tâches pour créer une chaîne de production audio numérique automatisée capable de fonctionner « sans supervision ».
Il ne s’agit pas d’un produit autonome, mais d’une application pratique de la stratégie « double voie de production » de la plateforme. Elle partage la même infrastructure technique que l’atelier de création professionnel existant de Wanzhuang Yousheng, mais fonctionne en mode entièrement automatique, répondant au défi le plus critique de l’industrie : comment réaliser un bond en avant en capacité et une réduction des coûts sans compromettre la qualité.

Du « manuel » à l’« autopilote » : un moteur, deux voies
La production traditionnelle d’audiobooks de haute qualité est un processus long et coûteux, nécessitant un travail manuel pour le tri des manuscrits, la division en chapitres, la création de scripts, le casting, le doublage, l’alignement, le mixage post-production, les vérifications qualité et l’exportation. La production d’un audiobook multi-personnages de haute qualité peut prendre plus de 30 jours et coûter plusieurs milliers à plusieurs dizaines de milliers de yuans.
La première ligne de produits de Wanzhuang Yousheng, « Voie 1 : Amélioration de la qualité », a été conçue pour résoudre le problème du « faire mieux ».
Elle offre un outil de création par IA sur tout le cycle pour les studios professionnels et les équipes de doublage. Des modules tels que la création intelligente de scripts, l’alignement intelligent et l’écoute intelligente libèrent les créateurs des tâches fastidieuses et répétitives, leur permettant de se concentrer sur l’expression artistique. La logique centrale reste une collaboration profonde entre l’homme et la machine.

La nouvelle station de travail entièrement automatique pour la création d’audiobooks multi-voix par IA appartient à « Voie 2 : Bond en capacité ».
Son objectif est entièrement différent : elle n’est pas destinée aux créateurs minutieux, mais aux clients B-to-B tels que les plateformes de littérature en ligne et les institutions éditoriales qui détiennent d’importantes quantités de droits d’auteur et doivent convertir leurs stocks rapidement. Sa logique est simple : utiliser une solution entièrement automatisée pour résoudre le défi de l’évolutivité du contenu massif, à longue traîne et sensible au retour sur investissement.
Après que les utilisateurs ont téléchargé des manuscrits, le système fonctionne comme une super usine numérique : division automatique des chapitres, analyse intelligente des personnages et attribution de la meilleure voix IA, génération de scripts avec annotations émotionnelles et prononciation précise, utilisation de près de mille tons vocaux optimisés pour la narration multi-personnages, et enfin synthèse du produit final avec des effets sonores. Après la génération, le travail est transféré vers une interface d’édition standard, où les utilisateurs peuvent utiliser de nouvelles fonctionnalités telles que la « prononciation personnalisée » et l’« annotation par lots » pour effectuer des ajustements locaux, atteignant ainsi un modèle de production flexible consistant à « produire en masse des ébauches, puis à effectuer des ajustements locaux ».

7 yuans pour 10 000 caractères : effacer un compte disruptif
Wanzhuang Yousheng a fixé un prix hautement compétitif : 7,9 yuans pour 10 000 caractères pour le doublage par IA, 0,2 yuan pour 10 000 caractères pour la création intelligente de scripts, et jusqu’à 6,58 yuans pour 10 000 caractères pour les achats en gros. Cela signifie que le coût total pour produire un audiobook multi-voix de 10 000 caractères n’est que de 7 à 8 yuans.
En comparaison, les méthodes traditionnelles nécessitent entre 5 000 et 50 000 yuans pour un seul audiobook ; les autres outils d’IA sur le marché se situent généralement entre 10 et 15 yuans pour 10 000 caractères. Pour les plateformes de droits détenant des milliers d’œuvres IP de longueur moyenne, la méthode traditionnelle nécessiterait un investissement de dizaines de millions, voire de centaines de millions de yuans pour une conversion complète en audiobooks. Même si seulement 10 % étaient convertis, cela représenterait une charge lourde. Cependant, selon les tarifs de Wanzhuang Yousheng, le coût de conversion en audiobook d’un roman de 500 000 caractères ne serait que de 350 à 400 yuans. Une maison d’édition de taille moyenne pourrait transformer une catégorie entière de stocks en actifs audio pour seulement quelques dizaines de milliers de yuans.
Li Ji, fondateur de Yuemei Culture, un titulaire de droits de premier plan dans le domaine des romans Xiangguan, a commenté lors du lancement des tests publics de Wanzhuang Yousheng : « Le doublage par IA de Wanzhuang Yousheng a déjà atteint le niveau des performances humaines réelles en matière de transmission émotionnelle. Combiné à la création intelligente de scripts et à l’alignement automatique, il peut produire stablement des audiobooks de niveau B+ ou supérieur. »
Ce standard de qualité a été transféré à la ligne de production entièrement automatique, faisant de « une qualité acceptable par ligne de production » une condition préalable. Le problème central restant devient alors purement un calcul économique.
Se concentrer sur le B-to-B : implications stratégiques du moteur double voie
Cette station de travail entièrement automatique a été utilisée en interne initialement pour démontrer une « suprématie technique » aux titulaires de droits et aux investisseurs. Maintenant, elle est commercialisée, envoyant un signal clair.
Cela marque l’expansion de la portée de Wanzhuang Yousheng de « servir les créateurs » à « servir les titulaires de droits » — ces derniers étant le groupe client principal disposant d’une capacité de paiement significative et d’une demande urgente. La « double voie de production » unique de la plateforme n’est pas simplement une collection de fonctionnalités, mais repose sur une compréhension profonde de l’industrie : le marché des audiobooks fait face simultanément à deux besoins apparemment contradictoires — une qualité premium et une production de masse. Le véritable goulot d’étranglement réside dans l’absence d’un système de production standardisé capable de s’adapter dynamiquement à différentes valeurs de contenu et demandes de production.
· Pour les individus ou petites équipes, il sert de « validateur de contenu » efficace, permettant aux romans d’être rapidement transformés en démos partageables sans besoin d’une équipe professionnelle, permettant ainsi des tests de marché à faible coût.
· Pour les plateformes de littérature en ligne ou les institutions de droits, il répond directement au dilemme des œuvres IP de longueur moyenne « sans saveur mais difficiles à abandonner », réveillant les stocks dormants à un coût marginal minimal et comblant rapidement les lacunes en contenu.
· Pour les studios audio professionnels, il ouvre un nouveau modèle « hybride homme-machine ». Les personnages principaux complexes nécessitant des émotions peuvent être laissés aux comédiens de voix réels, tandis que les narrations et un grand nombre de rôles de PNJ peuvent être gérés par une IA de haute qualité, garantissant l’expérience auditive tout en élargissant significativement la capacité de production.
Les barrières techniques sous-jacentes, telles qu’un dictionnaire de correction de prononciation de million de mots, des algorithmes de cohérence des personnages et une technologie de redessin intelligent (qui peut réduire la consommation de puissance de calcul de 90 % pour les modifications locales), sont le résultat d’une intégration profonde de l’expérience de production du secteur des audiobooks. Il ne s’agit pas seulement d’une victoire technologique, mais aussi d’une définition claire du chemin vers l’industrialisation de la production audio.
Ayant testé avec succès la ligne de production interne, l’équipe ose livrer aux clients externes. Sa portée s’est étendue de « servir les créateurs » à « servir les titulaires de droits » — les vrais clients disposant de capacités de paiement en gros.
Pour des plateformes comme Yewen et Qimao, ou les groupes d’édition traditionnels, la véritable préoccupation n’est pas « pouvons-nous créer un audiobook de haute qualité », mais « avec des milliers d’œuvres dans notre bibliothèque, comment pouvons-nous les convertir en contenu audio de manière rentable et à grande échelle ». Cette station de travail entièrement automatique leur offre une ligne de production qu’ils peuvent activer à la demande. Elle n’est pas destinée aux créateurs individuels.
Les institutions de droits ont des cycles de décision longs, et il faut du temps, du contact initial à la production en volume. Les éditeurs traditionnels sont habitués aux modèles de sous-traitance, et le passage à l’automatisation par IA nécessite des changements internes dans les processus et le contrôle qualité. Cependant, le coût de production des audiobooks diminue rapidement. Lorsque le coût de production d’un audiobook de 10 000 caractères passe de plusieurs milliers de yuans à seulement quelques yuans, la logique d’offre de l’industrie changera inévitablement.
À propos de Wanzhuang Yousheng
Wanzhuang Yousheng (Audimind) a été fondée en 2024 par l’ancienne équipe de direction centrale de Lazy Listen. C’est une plateforme tout-en-un alimentée par l’IA pour la création de contenu audio. Grâce à son moteur de production double voie, la plateforme fournit des solutions complètes couvrant l’intégralité du processus de création d’audiobooks pour les créateurs professionnels et les institutions de droits.
Site Web : https://www.audimind.com/
Article connexe
Comment corriger les Core Web Vitals pour un meilleur classement SEO
Comment créer de beaux sites web à l'aide de l'IA et de Google SitesTable des matières :IntroductionMaîtriser la conception et la création de sites web avec Google SitesLe rôle de l'intelligence artificielle dans la conception web moderneConstru
Anthropic mise gros sur la puissance de calcul et prévoit un centre de données de gigawatts en Australie
Les rapports de l’industrie indiquent qu’Anthropic, un fournisseur majeur de grands modèles d’intelligence artificielle, entend acquérir au moins 1,4 GW de capacité de calcul pour centres de données en Australie. Cet investissement substantiel, estim
Des pirates informatiques en chapeau blanc ont compromis les comptes de chat GPT du personnel d'OpenAI en utilisant Claude, et réclament une prime de 6 500 dollars.
Le 18 septembre, le Journal du Wall Street a rapporté que des chercheurs en sécurité indépendants ont piraté le compte ChatGPT d’un employé d’OpenAI via Anthropic Claude, obtenant ainsi l’accès au dépôt de code logiciel privé de l’entreprise.L’équip
Recommandations de sujets spéciaux liés
commentaires (0)
Deux mois après sa bêta publique, Wanzhuang Yousheng a officiellement lancé son système de production automatisée, « Création entièrement automatique d’audiobooks multi-voix par IA », une fonctionnalité qui avait déjà conquis les titulaires de droits lors des essais internes.
Lancée par l’équipe centrale derrière Lazy Listen, cette plateforme de contenu audio par IA a achevé les tests publics de cette fonctionnalité stratégique en début juin. Au cœur du dispositif se trouve une combinaison de capacités éprouvées en IA — division intelligente des chapitres, analyse des personnages, génération de scripts, doublage multi-personnages et synthèse post-production — orchestrées par un moteur de tâches pour créer une chaîne de production audio numérique automatisée capable de fonctionner « sans supervision ».
Il ne s’agit pas d’un produit autonome, mais d’une application pratique de la stratégie « double voie de production » de la plateforme. Elle partage la même infrastructure technique que l’atelier de création professionnel existant de Wanzhuang Yousheng, mais fonctionne en mode entièrement automatique, répondant au défi le plus critique de l’industrie : comment réaliser un bond en avant en capacité et une réduction des coûts sans compromettre la qualité.

Du « manuel » à l’« autopilote » : un moteur, deux voies
La production traditionnelle d’audiobooks de haute qualité est un processus long et coûteux, nécessitant un travail manuel pour le tri des manuscrits, la division en chapitres, la création de scripts, le casting, le doublage, l’alignement, le mixage post-production, les vérifications qualité et l’exportation. La production d’un audiobook multi-personnages de haute qualité peut prendre plus de 30 jours et coûter plusieurs milliers à plusieurs dizaines de milliers de yuans.
La première ligne de produits de Wanzhuang Yousheng, « Voie 1 : Amélioration de la qualité », a été conçue pour résoudre le problème du « faire mieux ».
Elle offre un outil de création par IA sur tout le cycle pour les studios professionnels et les équipes de doublage. Des modules tels que la création intelligente de scripts, l’alignement intelligent et l’écoute intelligente libèrent les créateurs des tâches fastidieuses et répétitives, leur permettant de se concentrer sur l’expression artistique. La logique centrale reste une collaboration profonde entre l’homme et la machine.

La nouvelle station de travail entièrement automatique pour la création d’audiobooks multi-voix par IA appartient à « Voie 2 : Bond en capacité ».
Son objectif est entièrement différent : elle n’est pas destinée aux créateurs minutieux, mais aux clients B-to-B tels que les plateformes de littérature en ligne et les institutions éditoriales qui détiennent d’importantes quantités de droits d’auteur et doivent convertir leurs stocks rapidement. Sa logique est simple : utiliser une solution entièrement automatisée pour résoudre le défi de l’évolutivité du contenu massif, à longue traîne et sensible au retour sur investissement.
Après que les utilisateurs ont téléchargé des manuscrits, le système fonctionne comme une super usine numérique : division automatique des chapitres, analyse intelligente des personnages et attribution de la meilleure voix IA, génération de scripts avec annotations émotionnelles et prononciation précise, utilisation de près de mille tons vocaux optimisés pour la narration multi-personnages, et enfin synthèse du produit final avec des effets sonores. Après la génération, le travail est transféré vers une interface d’édition standard, où les utilisateurs peuvent utiliser de nouvelles fonctionnalités telles que la « prononciation personnalisée » et l’« annotation par lots » pour effectuer des ajustements locaux, atteignant ainsi un modèle de production flexible consistant à « produire en masse des ébauches, puis à effectuer des ajustements locaux ».

7 yuans pour 10 000 caractères : effacer un compte disruptif
Wanzhuang Yousheng a fixé un prix hautement compétitif : 7,9 yuans pour 10 000 caractères pour le doublage par IA, 0,2 yuan pour 10 000 caractères pour la création intelligente de scripts, et jusqu’à 6,58 yuans pour 10 000 caractères pour les achats en gros. Cela signifie que le coût total pour produire un audiobook multi-voix de 10 000 caractères n’est que de 7 à 8 yuans.
En comparaison, les méthodes traditionnelles nécessitent entre 5 000 et 50 000 yuans pour un seul audiobook ; les autres outils d’IA sur le marché se situent généralement entre 10 et 15 yuans pour 10 000 caractères. Pour les plateformes de droits détenant des milliers d’œuvres IP de longueur moyenne, la méthode traditionnelle nécessiterait un investissement de dizaines de millions, voire de centaines de millions de yuans pour une conversion complète en audiobooks. Même si seulement 10 % étaient convertis, cela représenterait une charge lourde. Cependant, selon les tarifs de Wanzhuang Yousheng, le coût de conversion en audiobook d’un roman de 500 000 caractères ne serait que de 350 à 400 yuans. Une maison d’édition de taille moyenne pourrait transformer une catégorie entière de stocks en actifs audio pour seulement quelques dizaines de milliers de yuans.
Li Ji, fondateur de Yuemei Culture, un titulaire de droits de premier plan dans le domaine des romans Xiangguan, a commenté lors du lancement des tests publics de Wanzhuang Yousheng : « Le doublage par IA de Wanzhuang Yousheng a déjà atteint le niveau des performances humaines réelles en matière de transmission émotionnelle. Combiné à la création intelligente de scripts et à l’alignement automatique, il peut produire stablement des audiobooks de niveau B+ ou supérieur. »
Ce standard de qualité a été transféré à la ligne de production entièrement automatique, faisant de « une qualité acceptable par ligne de production » une condition préalable. Le problème central restant devient alors purement un calcul économique.
Se concentrer sur le B-to-B : implications stratégiques du moteur double voie
Cette station de travail entièrement automatique a été utilisée en interne initialement pour démontrer une « suprématie technique » aux titulaires de droits et aux investisseurs. Maintenant, elle est commercialisée, envoyant un signal clair.
Cela marque l’expansion de la portée de Wanzhuang Yousheng de « servir les créateurs » à « servir les titulaires de droits » — ces derniers étant le groupe client principal disposant d’une capacité de paiement significative et d’une demande urgente. La « double voie de production » unique de la plateforme n’est pas simplement une collection de fonctionnalités, mais repose sur une compréhension profonde de l’industrie : le marché des audiobooks fait face simultanément à deux besoins apparemment contradictoires — une qualité premium et une production de masse. Le véritable goulot d’étranglement réside dans l’absence d’un système de production standardisé capable de s’adapter dynamiquement à différentes valeurs de contenu et demandes de production.
· Pour les individus ou petites équipes, il sert de « validateur de contenu » efficace, permettant aux romans d’être rapidement transformés en démos partageables sans besoin d’une équipe professionnelle, permettant ainsi des tests de marché à faible coût.
· Pour les plateformes de littérature en ligne ou les institutions de droits, il répond directement au dilemme des œuvres IP de longueur moyenne « sans saveur mais difficiles à abandonner », réveillant les stocks dormants à un coût marginal minimal et comblant rapidement les lacunes en contenu.
· Pour les studios audio professionnels, il ouvre un nouveau modèle « hybride homme-machine ». Les personnages principaux complexes nécessitant des émotions peuvent être laissés aux comédiens de voix réels, tandis que les narrations et un grand nombre de rôles de PNJ peuvent être gérés par une IA de haute qualité, garantissant l’expérience auditive tout en élargissant significativement la capacité de production.
Les barrières techniques sous-jacentes, telles qu’un dictionnaire de correction de prononciation de million de mots, des algorithmes de cohérence des personnages et une technologie de redessin intelligent (qui peut réduire la consommation de puissance de calcul de 90 % pour les modifications locales), sont le résultat d’une intégration profonde de l’expérience de production du secteur des audiobooks. Il ne s’agit pas seulement d’une victoire technologique, mais aussi d’une définition claire du chemin vers l’industrialisation de la production audio.
Ayant testé avec succès la ligne de production interne, l’équipe ose livrer aux clients externes. Sa portée s’est étendue de « servir les créateurs » à « servir les titulaires de droits » — les vrais clients disposant de capacités de paiement en gros.
Pour des plateformes comme Yewen et Qimao, ou les groupes d’édition traditionnels, la véritable préoccupation n’est pas « pouvons-nous créer un audiobook de haute qualité », mais « avec des milliers d’œuvres dans notre bibliothèque, comment pouvons-nous les convertir en contenu audio de manière rentable et à grande échelle ». Cette station de travail entièrement automatique leur offre une ligne de production qu’ils peuvent activer à la demande. Elle n’est pas destinée aux créateurs individuels.
Les institutions de droits ont des cycles de décision longs, et il faut du temps, du contact initial à la production en volume. Les éditeurs traditionnels sont habitués aux modèles de sous-traitance, et le passage à l’automatisation par IA nécessite des changements internes dans les processus et le contrôle qualité. Cependant, le coût de production des audiobooks diminue rapidement. Lorsque le coût de production d’un audiobook de 10 000 caractères passe de plusieurs milliers de yuans à seulement quelques yuans, la logique d’offre de l’industrie changera inévitablement.
À propos de Wanzhuang Yousheng
Wanzhuang Yousheng (Audimind) a été fondée en 2024 par l’ancienne équipe de direction centrale de Lazy Listen. C’est une plateforme tout-en-un alimentée par l’IA pour la création de contenu audio. Grâce à son moteur de production double voie, la plateforme fournit des solutions complètes couvrant l’intégralité du processus de création d’audiobooks pour les créateurs professionnels et les institutions de droits.
Site Web : https://www.audimind.com/
Comment corriger les Core Web Vitals pour un meilleur classement SEO
Comment créer de beaux sites web à l'aide de l'IA et de Google SitesTable des matières :IntroductionMaîtriser la conception et la création de sites web avec Google SitesLe rôle de l'intelligence artificielle dans la conception web moderneConstru
Anthropic mise gros sur la puissance de calcul et prévoit un centre de données de gigawatts en Australie
Les rapports de l’industrie indiquent qu’Anthropic, un fournisseur majeur de grands modèles d’intelligence artificielle, entend acquérir au moins 1,4 GW de capacité de calcul pour centres de données en Australie. Cet investissement substantiel, estim
Des pirates informatiques en chapeau blanc ont compromis les comptes de chat GPT du personnel d'OpenAI en utilisant Claude, et réclament une prime de 6 500 dollars.
Le 18 septembre, le Journal du Wall Street a rapporté que des chercheurs en sécurité indépendants ont piraté le compte ChatGPT d’un employé d’OpenAI via Anthropic Claude, obtenant ainsi l’accès au dépôt de code logiciel privé de l’entreprise.L’équip











