Maison
SkyReels V4 en tête du classement mondial des vidéos ; la technologie audiovisuelle chinoise basée sur l'IA atteint un niveau mondial
SkyReels V4 de Kunlun Wanyi, qui fait partie de sa famille de grands modèles d’IA TianGong, s’est hissé à la première place mondiale dans la catégorie « texte-vidéo (avec audio) » sur Artificial Analysis. Ses performances surpassent largement celles des modèles courants, notamment Kling 3.0, Google Veo 3.1, Vidu Q3 et OpenAI Sora 2, s’imposant ainsi comme le modèle d’IA à grande échelle le plus puissant au monde pour la génération de vidéos à l’heure actuelle.

Principales avancées : apprentissage par renforcement multimodal et raisonnement logique
SkyReels V4 introduit deux innovations architecturales majeures qui répondent à des défis de longue date en matière de cohérence de la génération vidéo et de logique narrative :
Système d’apprentissage par renforcement (RL): en construisant un modèle de récompense sémantique multimodal et en suivant un parcours d’apprentissage par étapes, le système dote le modèle de capacités de raisonnement logique, permettant ainsi la génération de vidéos de longue durée de qualité commerciale en résolution 1080p pendant 15 secondes.
Tâches de référence avancées: parmi les nouvelles fonctionnalités figurent la « référence par images clés » et la « référence par grille ». La première permet de déduire avec précision des scènes cohérentes entre les nœuds clés, tandis que la seconde permet aux utilisateurs de télécharger plusieurs images illustrant l’histoire, garantissant ainsi la cohérence des traits des personnages et des styles de scène tout au long de la création d’un court-métrage.
Grâce à ce classement de premier plan, l’API SkyReels V4 est désormais officiellement ouverte à tous les scénarios, offrant un accès complet aux capacités principales du modèle :
Couverture complète des fonctionnalités: y compris la conversion texte-vidéo, image-vidéo, la génération multimodale à partir de références, le montage et la correction vidéo, ainsi que la génération audiovisuelle conjointe.
Une mise à disposition accessible à tous: le commerce en ligne, l’éducation, les plateformes de contenu et les équipes de développement peuvent directement tirer parti de capacités de génération audiovisuelle de pointe sans investissement significatif en R&D.
Kunlun Wanyi a déjà publié et mis en open source plusieurs modèles de la série SkyReels. De la génération pilotée par l’humain de la V1 à la génération de vidéos longues de la V2, en passant par la percée globale de la V4 en matière de synchronisation audiovisuelle et d’expression logique, la famille SkyReels illustre une évolution claire, passant de la simple « capacité à générer » à la capacité de « bien générer ».
Le rapport technique sur SkyReels V4 a été publié parallèlement à cette annonce. Les développeurs peuvent accéder à la documentation de l’API et commencer l’intégration dans leurs applications via la plateforme officielle. Cette étape importante marque la prise de position de l’IA chinoise en tant que leader mondial dans le secteur vertical de la génération de contenus audiovisuels.
Article connexe
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés
Conformité des véhicules autonomes en Californie : une nouvelle ère marquée par les amendes, les zones de géolocalisation et 1 million de miles
Guident exploite une navette AuveTech dans le sud de la Floride, gérant un parcours de quatre miles à West Palm Beach et un parcours d’un mile à Boca Raton grâce à sa technologie de surveillance à dis
Recommandations de sujets spéciaux liés
commentaires (0)
SkyReels V4 de Kunlun Wanyi, qui fait partie de sa famille de grands modèles d’IA TianGong, s’est hissé à la première place mondiale dans la catégorie « texte-vidéo (avec audio) » sur Artificial Analysis. Ses performances surpassent largement celles des modèles courants, notamment Kling 3.0, Google Veo 3.1, Vidu Q3 et OpenAI Sora 2, s’imposant ainsi comme le modèle d’IA à grande échelle le plus puissant au monde pour la génération de vidéos à l’heure actuelle.

Principales avancées : apprentissage par renforcement multimodal et raisonnement logique
SkyReels V4 introduit deux innovations architecturales majeures qui répondent à des défis de longue date en matière de cohérence de la génération vidéo et de logique narrative :
Système d’apprentissage par renforcement (RL): en construisant un modèle de récompense sémantique multimodal et en suivant un parcours d’apprentissage par étapes, le système dote le modèle de capacités de raisonnement logique, permettant ainsi la génération de vidéos de longue durée de qualité commerciale en résolution 1080p pendant 15 secondes.
Tâches de référence avancées: parmi les nouvelles fonctionnalités figurent la « référence par images clés » et la « référence par grille ». La première permet de déduire avec précision des scènes cohérentes entre les nœuds clés, tandis que la seconde permet aux utilisateurs de télécharger plusieurs images illustrant l’histoire, garantissant ainsi la cohérence des traits des personnages et des styles de scène tout au long de la création d’un court-métrage.
Grâce à ce classement de premier plan, l’API SkyReels V4 est désormais officiellement ouverte à tous les scénarios, offrant un accès complet aux capacités principales du modèle :
Couverture complète des fonctionnalités: y compris la conversion texte-vidéo, image-vidéo, la génération multimodale à partir de références, le montage et la correction vidéo, ainsi que la génération audiovisuelle conjointe.
Une mise à disposition accessible à tous: le commerce en ligne, l’éducation, les plateformes de contenu et les équipes de développement peuvent directement tirer parti de capacités de génération audiovisuelle de pointe sans investissement significatif en R&D.
Kunlun Wanyi a déjà publié et mis en open source plusieurs modèles de la série SkyReels. De la génération pilotée par l’humain de la V1 à la génération de vidéos longues de la V2, en passant par la percée globale de la V4 en matière de synchronisation audiovisuelle et d’expression logique, la famille SkyReels illustre une évolution claire, passant de la simple « capacité à générer » à la capacité de « bien générer ».
Le rapport technique sur SkyReels V4 a été publié parallèlement à cette annonce. Les développeurs peuvent accéder à la documentation de l’API et commencer l’intégration dans leurs applications via la plateforme officielle. Cette étape importante marque la prise de position de l’IA chinoise en tant que leader mondial dans le secteur vertical de la génération de contenus audiovisuels.
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés











