Maison
Le plugin IA de Sakana AI simplifie le traitement des documents pour les grands modèles
Les difficultés rencontrées par les grands modèles linguistiques dans le traitement de textes longs, souvent qualifiées d’« anxiété de mémoire », pourraient bientôt appartenir au passé. Récemment, la start-up d'IA Sakana AI, basée à Tokyo, a dévoilé deux technologies révolutionnaires : Text-to-LoRA (T2L) et Doc-to-LoRA (D2L). Grâce à une architecture innovante de « super-réseau », ces technologies permettent aux grands modèles d'« absorber » des documents volumineux ou d'apprendre de nouvelles tâches en moins d'une seconde, le tout sans réentraînement.

Les développeurs d'IA sont depuis longtemps confrontés à un choix difficile : entasser de longs documents dans une fenêtre de chat — ce qui ralentit les réponses et consomme beaucoup de mémoire — ou payer le coût élevé du réglage fin d'un modèle. Sakana AI propose une troisième option. Grâce à un paiement unique pour le pré-entraînement, elle génère des plugins de poids minimes (LoRA) pour permettre une adaptation des modèles efficace et à faible coût.
Doc-to-LoRA : les besoins en mémoire passent de 12 Go à seulement 50 Mo
Il s'agit de la technologie la plus impressionnante de cette dernière version. Le traitement d'un document de 128 000 tokens (environ 100 000 mots) avec les méthodes traditionnelles nécessite plus de 12 Go de VRAM pour stocker les informations. Avec D2L, le modèle peut directement « digérer » ces informations pour les transformer en un plugin de moins de 50 Mo.
Une vitesse remarquable: les technologies existantes nécessitent entre 40 et 100 secondes pour traiter un document, tandis que D2L y parvient en moins d'une seconde.
Repousser les limites: cela permet aux modèles de traiter des textes jusqu’à quatre fois plus longs que leur fenêtre de contexte d’origine, atteignant une précision quasi parfaite lors de tests de recherche de type « aiguille dans une botte de foin ».
Text-to-LoRA : personnaliser l'IA avec le langage courant
Text-to-LoRA rend les modèles plus réactifs. Les utilisateurs décrivent simplement une tâche en langage naturel — par exemple, « aide-moi à résoudre un problème complexe de mathématiques » — et le système génère automatiquement un plugin dédié pour améliorer les performances. Des expériences révèlent que les adaptateurs créés de cette manière peuvent surpasser les modèles dédiés entraînés à partir de zéro sur des tâches de mathématiques et de raisonnement logique.
Une technologie intermodale puissante : permettre aux modèles textuels de « voir » les images
Les chercheurs ont découvert un avantage inattendu : D2L présente de solides capacités cross-modales. En mappant les informations visuelles dans les paramètres d’un modèle purement textuel, un modèle qui n’a jamais traité d’images auparavant peut les classer avec une précision de **75,03 %**.
Les réalisations de Sakana AI réduisent considérablement les obstacles pour les particuliers et les entreprises souhaitant personnaliser des modèles d'IA privés. Elles ouvrent également une nouvelle voie vers le développement d'une intelligence artificielle générale (AGI) plus légère et plus intelligente.
Article : https://arxiv.org/pdf/2602.15902
Article connexe
Les lunettes intelligentes d’Apple pourraient être présentées lors de la WWDC27, mettant en avant la protection de la vie privée
Mark Gurman de Bloomberg rapporte que les lunettes intelligentes d’Apple, codifiées N50, sont prévues pour une présentation lors de la WWDC27 en juin 2027, avec un lancement commercial attendu à l’automne 2027. Initialement destinées à la fin de cett
À l’intérieur des détails révélés sur le prochain Gemini : une puissance de calcul mise à rude épreuve, des équipes internes en désaccord sur les priorités de développement et l’allocation des ressources
Les rapports indiquent que le lancement du modèle Gemini de nouvelle génération, tant attendu par Google, a été repoussé. Des désaccords internes concernant les priorités de développement et l'allocation des ressources, combinés à une capacité de cal
OpenAI rejette les inquiétudes concernant un ralentissement de la croissance, affirmant que plusieurs unités commerciales accélèrent
En réponse aux critiques externes concernant la décélération de la croissance des ventes et le non-respect des objectifs internes, le leader de l'IA, OpenAI, a publié une déclaration rassurante le mardi 28 avril. L'entreprise a précisé que ses produi
Recommandations de sujets spéciaux liés
commentaires (0)
Les difficultés rencontrées par les grands modèles linguistiques dans le traitement de textes longs, souvent qualifiées d’« anxiété de mémoire », pourraient bientôt appartenir au passé. Récemment, la start-up d'IA Sakana AI, basée à Tokyo, a dévoilé deux technologies révolutionnaires : Text-to-LoRA (T2L) et Doc-to-LoRA (D2L). Grâce à une architecture innovante de « super-réseau », ces technologies permettent aux grands modèles d'« absorber » des documents volumineux ou d'apprendre de nouvelles tâches en moins d'une seconde, le tout sans réentraînement.

Les développeurs d'IA sont depuis longtemps confrontés à un choix difficile : entasser de longs documents dans une fenêtre de chat — ce qui ralentit les réponses et consomme beaucoup de mémoire — ou payer le coût élevé du réglage fin d'un modèle. Sakana AI propose une troisième option. Grâce à un paiement unique pour le pré-entraînement, elle génère des plugins de poids minimes (LoRA) pour permettre une adaptation des modèles efficace et à faible coût.
Doc-to-LoRA : les besoins en mémoire passent de 12 Go à seulement 50 Mo
Il s'agit de la technologie la plus impressionnante de cette dernière version. Le traitement d'un document de 128 000 tokens (environ 100 000 mots) avec les méthodes traditionnelles nécessite plus de 12 Go de VRAM pour stocker les informations. Avec D2L, le modèle peut directement « digérer » ces informations pour les transformer en un plugin de moins de 50 Mo.
Une vitesse remarquable: les technologies existantes nécessitent entre 40 et 100 secondes pour traiter un document, tandis que D2L y parvient en moins d'une seconde.
Repousser les limites: cela permet aux modèles de traiter des textes jusqu’à quatre fois plus longs que leur fenêtre de contexte d’origine, atteignant une précision quasi parfaite lors de tests de recherche de type « aiguille dans une botte de foin ».
Text-to-LoRA : personnaliser l'IA avec le langage courant
Text-to-LoRA rend les modèles plus réactifs. Les utilisateurs décrivent simplement une tâche en langage naturel — par exemple, « aide-moi à résoudre un problème complexe de mathématiques » — et le système génère automatiquement un plugin dédié pour améliorer les performances. Des expériences révèlent que les adaptateurs créés de cette manière peuvent surpasser les modèles dédiés entraînés à partir de zéro sur des tâches de mathématiques et de raisonnement logique.
Une technologie intermodale puissante : permettre aux modèles textuels de « voir » les images
Les chercheurs ont découvert un avantage inattendu : D2L présente de solides capacités cross-modales. En mappant les informations visuelles dans les paramètres d’un modèle purement textuel, un modèle qui n’a jamais traité d’images auparavant peut les classer avec une précision de **75,03 %**.
Les réalisations de Sakana AI réduisent considérablement les obstacles pour les particuliers et les entreprises souhaitant personnaliser des modèles d'IA privés. Elles ouvrent également une nouvelle voie vers le développement d'une intelligence artificielle générale (AGI) plus légère et plus intelligente.
Article : https://arxiv.org/pdf/2602.15902
Les lunettes intelligentes d’Apple pourraient être présentées lors de la WWDC27, mettant en avant la protection de la vie privée
Mark Gurman de Bloomberg rapporte que les lunettes intelligentes d’Apple, codifiées N50, sont prévues pour une présentation lors de la WWDC27 en juin 2027, avec un lancement commercial attendu à l’automne 2027. Initialement destinées à la fin de cett
À l’intérieur des détails révélés sur le prochain Gemini : une puissance de calcul mise à rude épreuve, des équipes internes en désaccord sur les priorités de développement et l’allocation des ressources
Les rapports indiquent que le lancement du modèle Gemini de nouvelle génération, tant attendu par Google, a été repoussé. Des désaccords internes concernant les priorités de développement et l'allocation des ressources, combinés à une capacité de cal
OpenAI rejette les inquiétudes concernant un ralentissement de la croissance, affirmant que plusieurs unités commerciales accélèrent
En réponse aux critiques externes concernant la décélération de la croissance des ventes et le non-respect des objectifs internes, le leader de l'IA, OpenAI, a publié une déclaration rassurante le mardi 28 avril. L'entreprise a précisé que ses produi











