Microsoft explore les contributeurs de données d'IA de crédits

Microsoft lance un nouveau projet de recherche visant à comprendre comment des exemples d'entraînement spécifiques influencent les sorties des modèles d'IA générative, tels que le texte, les images et autres médias. Cette initiative a été mise en lumière dans une offre d'emploi de décembre, récemment réapparue sur LinkedIn, recherchant un stagiaire de recherche pour rejoindre l'effort.
L'objectif du projet est de développer une méthode pour entraîner les modèles afin que l'impact de données particulières, comme des photos et des livres, sur leurs sorties puisse être "estimé efficacement et utilement". L'offre d'emploi souligne que les architectures actuelles des réseaux neuronaux manquent de transparence pour retracer l'origine de leurs sorties, et il existe des raisons convaincantes de résoudre ce problème. Une raison mentionnée est la possibilité d'offrir des incitations, une reconnaissance, voire une compensation aux individus contribuant des données précieuses aux futurs modèles d'IA.
Ce projet s'inscrit dans le contexte des batailles juridiques en cours impliquant des entreprises d'IA, y compris Microsoft, concernant les droits de propriété intellectuelle. Les modèles d'IA sont souvent entraînés sur de vastes ensembles de données extraits de sites web publics, qui peuvent inclure du matériel sous copyright. Bien que les entreprises d'IA revendiquent souvent la protection sous la doctrine de l'usage équitable, les créateurs de divers domaines — artistes, programmeurs, auteurs — contestent cette position.
Microsoft fait actuellement face à des défis juridiques, y compris une poursuite de The New York Times, qui allègue que Microsoft et OpenAI ont violé ses droits d'auteur en utilisant ses articles pour entraîner leurs modèles. De plus, plusieurs développeurs de logiciels ont poursuivi Microsoft au sujet de son assistant de codage AI GitHub Copilot, affirmant qu'il a été entraîné sur leur code sous copyright.
Le projet de recherche, appelé "provenance à l'entraînement", implique Jaron Lanier, un technologue notable chez Microsoft Research. Lanier a précédemment écrit sur la "dignité des données", plaidant pour un système qui relie le contenu numérique à ses créateurs et les compense potentiellement pour leurs contributions aux sorties d'IA.
Bien que le projet de Microsoft en soit encore à ses débuts, d'autres entreprises comme Bria, Adobe et Shutterstock expérimentent déjà la compensation des propriétaires de données en fonction de leurs contributions aux modèles d'IA. Cependant, les grands laboratoires d'IA n'ont généralement pas établi de programmes de paiement pour les contributeurs individuels, optant plutôt pour des accords de licence ou des mécanismes d'exclusion pour les détenteurs de droits d'auteur, qui peuvent être lourds et limités en portée.
L'initiative de Microsoft pourrait rester une preuve de concept, similaire à l'outil encore non publié d'OpenAI permettant aux créateurs de contrôler l'utilisation de leurs œuvres dans les données d'entraînement. Il y a aussi des spéculations selon lesquelles Microsoft pourrait tenter de "laver l'éthique" de ses pratiques en IA ou d'anticiper les défis réglementaires et juridiques.
Ce mouvement de Microsoft est particulièrement notable étant donné les récents appels d'autres laboratoires d'IA, comme Google et OpenAI, pour que le gouvernement américain assouplisse les protections des droits d'auteur pour le développement de l'IA. Microsoft n'a pas encore répondu aux demandes de commentaires sur ce projet.
Article connexe
L'ancien chef scientifique d'OpenAI, Ilya, dévoile son premier modèle SSI
L’intelligence artificielle a atteint un autre jalon majeur. Après son départ d’OpenAI, l’ancien scientifique en chef Ilya Sutskever a fondé Safe Superintelligence Inc. (SSI), qui a récemment dévoilé les détails de son premier modèle. Selon des rappo
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
Le 14 mai 2026, la plateforme de développement d’applications d’IA Lovable a annoncé sa participation à une levée de fonds amorce de 800 000 $ pour la startup danoise de matériel Atech. Pilotée par Lovable, cette levée de fonds a attiré des sociétés
Anthropic étend ses outils de codage IA Claude au Japon dans le cadre de sa stratégie de croissance à l’étranger
Anthropic, une entreprise américaine d’intelligence artificielle de premier plan, intensifie sa portée mondiale. Mercredi, l’entreprise a organisé une grande réunion de développeurs, « Code with Claude », à Tokyo, rassemblant près de 500 ingénieurs l
Recommandations de sujets spéciaux liés
commentaires (37)
Interesante proyecto, pero lo que realmente necesito es que alguien en la IA me explique por qué mi asistente virtual aún no puede organizarme el escritorio 😅. ¿Esto de la atribución podría cambiar cómo las empresas comparten datos? Me preocupa un poco la transparencia de todo el proceso. Ojalá no sea solo un gesto de relaciones públicas.
Lo de Microsoft parece interesante pero, ¿y la privacidad de los datos? 🤔 A veces siento que con toda esta exploración de IA, estamos perdiendo el control de lo que se usa para entrenar los modelos. ¿Habrá una compensación justa para quienes contribuyeron? No quiero que esto se convierta en otro caso de 'big tech' aprovechándose de 'datos gratis'...
이런 연구는 AI 데이터 기여자들에게 공정한 보상을 제공하는 데 중요한 단계가 될 수 있겠네요. 😊 근데 MS가 과연 저작권 문제를 해결할 수 있을지 의문이 드네요. 데이터 소싱 방식이 좀 더 투명해져야 할 시점인 것 같아요!
This is super intriguing! Microsoft's diving into how AI training data shapes outputs—mind-blowing stuff. Wonder how they'll credit contributors fairly? 🤔
This Microsoft AI project sounds intriguing! Crediting data contributors could reshape how we value creative input in AI. Curious to see if it'll spark ethical debates or just be a tech flex. 🤔

Microsoft lance un nouveau projet de recherche visant à comprendre comment des exemples d'entraînement spécifiques influencent les sorties des modèles d'IA générative, tels que le texte, les images et autres médias. Cette initiative a été mise en lumière dans une offre d'emploi de décembre, récemment réapparue sur LinkedIn, recherchant un stagiaire de recherche pour rejoindre l'effort.
L'objectif du projet est de développer une méthode pour entraîner les modèles afin que l'impact de données particulières, comme des photos et des livres, sur leurs sorties puisse être "estimé efficacement et utilement". L'offre d'emploi souligne que les architectures actuelles des réseaux neuronaux manquent de transparence pour retracer l'origine de leurs sorties, et il existe des raisons convaincantes de résoudre ce problème. Une raison mentionnée est la possibilité d'offrir des incitations, une reconnaissance, voire une compensation aux individus contribuant des données précieuses aux futurs modèles d'IA.
Ce projet s'inscrit dans le contexte des batailles juridiques en cours impliquant des entreprises d'IA, y compris Microsoft, concernant les droits de propriété intellectuelle. Les modèles d'IA sont souvent entraînés sur de vastes ensembles de données extraits de sites web publics, qui peuvent inclure du matériel sous copyright. Bien que les entreprises d'IA revendiquent souvent la protection sous la doctrine de l'usage équitable, les créateurs de divers domaines — artistes, programmeurs, auteurs — contestent cette position.
Microsoft fait actuellement face à des défis juridiques, y compris une poursuite de The New York Times, qui allègue que Microsoft et OpenAI ont violé ses droits d'auteur en utilisant ses articles pour entraîner leurs modèles. De plus, plusieurs développeurs de logiciels ont poursuivi Microsoft au sujet de son assistant de codage AI GitHub Copilot, affirmant qu'il a été entraîné sur leur code sous copyright.
Le projet de recherche, appelé "provenance à l'entraînement", implique Jaron Lanier, un technologue notable chez Microsoft Research. Lanier a précédemment écrit sur la "dignité des données", plaidant pour un système qui relie le contenu numérique à ses créateurs et les compense potentiellement pour leurs contributions aux sorties d'IA.
Bien que le projet de Microsoft en soit encore à ses débuts, d'autres entreprises comme Bria, Adobe et Shutterstock expérimentent déjà la compensation des propriétaires de données en fonction de leurs contributions aux modèles d'IA. Cependant, les grands laboratoires d'IA n'ont généralement pas établi de programmes de paiement pour les contributeurs individuels, optant plutôt pour des accords de licence ou des mécanismes d'exclusion pour les détenteurs de droits d'auteur, qui peuvent être lourds et limités en portée.
L'initiative de Microsoft pourrait rester une preuve de concept, similaire à l'outil encore non publié d'OpenAI permettant aux créateurs de contrôler l'utilisation de leurs œuvres dans les données d'entraînement. Il y a aussi des spéculations selon lesquelles Microsoft pourrait tenter de "laver l'éthique" de ses pratiques en IA ou d'anticiper les défis réglementaires et juridiques.
Ce mouvement de Microsoft est particulièrement notable étant donné les récents appels d'autres laboratoires d'IA, comme Google et OpenAI, pour que le gouvernement américain assouplisse les protections des droits d'auteur pour le développement de l'IA. Microsoft n'a pas encore répondu aux demandes de commentaires sur ce projet.
L'ancien chef scientifique d'OpenAI, Ilya, dévoile son premier modèle SSI
L’intelligence artificielle a atteint un autre jalon majeur. Après son départ d’OpenAI, l’ancien scientifique en chef Ilya Sutskever a fondé Safe Superintelligence Inc. (SSI), qui a récemment dévoilé les détails de son premier modèle. Selon des rappo
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
Le 14 mai 2026, la plateforme de développement d’applications d’IA Lovable a annoncé sa participation à une levée de fonds amorce de 800 000 $ pour la startup danoise de matériel Atech. Pilotée par Lovable, cette levée de fonds a attiré des sociétés
Anthropic étend ses outils de codage IA Claude au Japon dans le cadre de sa stratégie de croissance à l’étranger
Anthropic, une entreprise américaine d’intelligence artificielle de premier plan, intensifie sa portée mondiale. Mercredi, l’entreprise a organisé une grande réunion de développeurs, « Code with Claude », à Tokyo, rassemblant près de 500 ingénieurs l
Interesante proyecto, pero lo que realmente necesito es que alguien en la IA me explique por qué mi asistente virtual aún no puede organizarme el escritorio 😅. ¿Esto de la atribución podría cambiar cómo las empresas comparten datos? Me preocupa un poco la transparencia de todo el proceso. Ojalá no sea solo un gesto de relaciones públicas.
Lo de Microsoft parece interesante pero, ¿y la privacidad de los datos? 🤔 A veces siento que con toda esta exploración de IA, estamos perdiendo el control de lo que se usa para entrenar los modelos. ¿Habrá una compensación justa para quienes contribuyeron? No quiero que esto se convierta en otro caso de 'big tech' aprovechándose de 'datos gratis'...
이런 연구는 AI 데이터 기여자들에게 공정한 보상을 제공하는 데 중요한 단계가 될 수 있겠네요. 😊 근데 MS가 과연 저작권 문제를 해결할 수 있을지 의문이 드네요. 데이터 소싱 방식이 좀 더 투명해져야 할 시점인 것 같아요!
This is super intriguing! Microsoft's diving into how AI training data shapes outputs—mind-blowing stuff. Wonder how they'll credit contributors fairly? 🤔
This Microsoft AI project sounds intriguing! Crediting data contributors could reshape how we value creative input in AI. Curious to see if it'll spark ethical debates or just be a tech flex. 🤔





Maison






