Option
Heim
Nachricht
AI -Benchmarks: Sollten wir sie vorerst ignorieren?

AI -Benchmarks: Sollten wir sie vorerst ignorieren?

10. April 2025
283

Willkommen zum regelmäßigen AI-Newsletter von TechCrunch! Wir machen eine kleine Pause, aber keine Sorge, Sie können weiterhin unsere gesamte AI-Berichterstattung, einschließlich meiner Kolumnen, täglicher Analysen und aktueller Nachrichten, hier bei TechCrunch finden. Möchten Sie diese Geschichten jeden Tag direkt in Ihren Posteingang? Melden Sie sich einfach hier für unsere täglichen Newsletter an.

Diese Woche hat Elon Musks AI-Startup xAI sein neuestes Flaggschiff-AI-Modell, Grok 3, veröffentlicht, das die Grok-Chatbot-Apps des Unternehmens antreibt. Es wurde auf beeindruckenden 200.000 GPUs trainiert und übertrifft in Benchmarks für Mathematik, Programmierung und mehr eine Reihe anderer Top-Modelle, einschließlich einiger von OpenAI.

Aber lassen Sie uns darüber sprechen, was diese Benchmarks tatsächlich bedeuten.

Hier bei TC berichten wir über diese Benchmark-Zahlen, auch wenn wir nicht immer begeistert davon sind, weil sie eine der wenigen Möglichkeiten sind, wie die AI-Branche versucht zu zeigen, wie ihre Modelle verbessert werden. Das Problem ist, dass diese populären AI-Benchmarks oft auf obskuren Dingen basieren und Bewertungen liefern, die nicht wirklich widerspiegeln, wie gut die AI die Dinge macht, die die Menschen tatsächlich interessieren.

Ethan Mollick, Professor an der Wharton School, hat auf X erklärt, dass es einen echten Bedarf an besseren Tests und unabhängigen Gruppen gibt, die diese durchführen. Er wies darauf hin, dass AI-Unternehmen oft ihre eigenen Benchmark-Ergebnisse veröffentlichen, was es schwer macht, ihnen vollständig zu vertrauen.

„Öffentliche Benchmarks sind sowohl ‚meh‘ als auch gesättigt, was vieles beim AI-Testing wie Restaurantkritiken macht, basierend auf Geschmack“, schrieb Mollick. „Wenn AI für die Arbeit entscheidend ist, brauchen wir mehr.“

Es gibt viele Leute, die versuchen, neue Benchmarks für AI zu entwickeln, aber niemand kann sich darauf einigen, was am besten ist. Einige denken, dass Benchmarks sich auf wirtschaftliche Auswirkungen konzentrieren sollten, um nützlich zu sein, während andere glauben, dass die tatsächliche Akzeptanz und Nützlichkeit in der realen Welt die wahren Maßstäbe für Erfolg sind.

Diese Debatte könnte ewig weitergehen. Vielleicht sollten wir, wie X-Nutzer Roon vorschlägt, einfach weniger Aufmerksamkeit auf neue Modelle und Benchmarks richten, es sei denn, es gibt einen großen Durchbruch in der AI. Das wäre vielleicht besser für unsere geistige Gesundheit, auch wenn es bedeutet, etwas vom AI-Hype zu verpassen.

Wie erwähnt, macht This Week in AI eine Pause. Danke, dass ihr bei uns geblieben seid, liebe Leser, durch alle Höhen und Tiefen. Bis zum nächsten Mal.

Nachrichten

Bildnachweis: Nathan Laine/Bloomberg / Getty Images
OpenAI versucht, ChatGPT zu „entzensieren“. Max schrieb darüber, wie sie ihren Ansatz in der AI-Entwicklung ändern, um „intellektuelle Freiheit“ zu fördern, auch bei schwierigen oder kontroversen Themen.

Mira Murati, ehemalige CTO von OpenAI, hat ein neues Startup namens Thinking Machines Lab. Sie arbeiten an Tools, um „AI für die einzigartigen Bedürfnisse und Ziele [der Menschen] arbeiten zu lassen“.

xAI hat Grok 3 veröffentlicht und neue Funktionen zu den Grok-Apps für iOS und das Web hinzugefügt.

Meta veranstaltet im Frühjahr seine erste Entwicklerkonferenz, die sich auf generative AI konzentriert. Sie heißt LlamaCon, nach ihren Llama-Modellen, und findet am 29. April statt.

Paul schrieb über OpenEuroLLM, ein Projekt von etwa 20 Organisationen, um Basismodelle für „transparente AI in Europa“ zu entwickeln, die die „sprachliche und kulturelle Vielfalt“ aller EU-Sprachen respektiert.

Forschungspapier der Woche

OpenAI ChatGPT Website auf einem Laptop-Bildschirm in dieser Illustrationsaufnahme.

Bildnachweis: Jakub Porzycki/NurPhoto / Getty Images
OpenAI-Forscher haben einen neuen AI-Benchmark namens SWE-Lancer entwickelt, um zu testen, wie gut AI programmieren kann. Er besteht aus über 1.400 freiberuflichen Software-Engineering-Aufgaben, von der Fehlerbehebung und dem Hinzufügen von Funktionen bis hin zum Vorschlagen technischer Implementierungen.

OpenAI sagt, dass das leistungsstärkste Modell, Anthropic's Claude 3.5 Sonnet, nur 40,3 % beim vollständigen SWE-Lancer-Benchmark erreicht hat, was zeigt, dass AI noch einen weiten Weg vor sich hat. Sie haben neuere Modelle wie OpenAI's o3-mini oder DeepSeek's R1 aus China nicht getestet.

Modell der Woche

Ein chinesisches AI-Unternehmen namens Stepfun hat ein „offenes“ AI-Modell namens Step-Audio veröffentlicht, das Sprache in Chinesisch, Englisch und Japanisch verstehen und generieren kann. Benutzer können sogar die Emotion und den Dialekt des synthetischen Audios anpassen, einschließlich Gesang.

Stepfun ist eines von mehreren gut finanzierten chinesischen AI-Startups, die Modelle mit permissiven Lizenzen veröffentlichen. Gegründet im Jahr 2023, schlossen sie kürzlich eine Finanzierungsrunde im Wert von Hunderten von Millionen ab, von Investoren, einschließlich chinesischer staatlicher Private-Equity-Firmen.

Bunter Mix

Nous Research DeepHermes

Bildnachweis: Nous Research
Nous Research, eine AI-Forschungsgruppe, behauptet, eines der ersten AI-Modelle veröffentlicht zu haben, das Denken mit „intuitiven Sprachmodellfähigkeiten“ kombiniert.

Ihr Modell, DeepHermes-3 Preview, kann zwischen kurzen und langen „Gedankeketten“ wechseln, um Genauigkeit und Rechenleistung auszubalancieren. Im „Denk“-Modus nimmt es mehr Zeit, um schwierigere Probleme zu lösen, und zeigt dabei seinen Denkprozess.

Anthropic plant Berichten zufolge bald ein ähnliches Modell zu veröffentlichen, und OpenAI sagt, es steht auf ihrer kurzfristigen Roadmap.

Verwandter Artikel
OpenAI bringt eine sicherere Version von ChatGPT für Jugendliche auf den Markt, Jahre nachdem diese begonnen hatten, die Plattform zu nutzen OpenAI bringt eine sicherere Version von ChatGPT für Jugendliche auf den Markt, Jahre nachdem diese begonnen hatten, die Plattform zu nutzen Nach einer Reihe von Gerichtsverfahren wegen fehlender Sicherheitsvorkehrungen bei KI-Chatbots – die zu Selbstmorden unter Jugendlichen und anderen psychischen Krisen beigetragen hatten – stellte Open
Frontier AI Labs weigert sich, Eindämmungsstrategien für außer Kontrolle geratene Modelle offenzulegen Frontier AI Labs weigert sich, Eindämmungsstrategien für außer Kontrolle geratene Modelle offenzulegen Jüngste Untersuchungen zeigen, dass nur sehr wenige führende KI-Forschungslabore Maßnahmenpläne zur Eindämmung veröffentlicht oder vorgeführt haben. Ein solcher Eindämmungsplan legt die Vorgehensweise
NEAs Tiffany Luck: Unternehmen kämpfen weiterhin mit der ROI von KI NEAs Tiffany Luck: Unternehmen kämpfen weiterhin mit der ROI von KI Laden des Players…Anfang dieses Jahres dominierte „Tokenmaxxing“ das Silicon Valley, wobei CEOs ihre Mitarbeiter aufforderten, die Nutzung von KI zu maximieren. Diese Begeisterung stieß jedoch schnell auf die Realität. Berichten zufolge hat Uber sei
Empfehlungen zu verwandten Spezialthemen
Musikkomposition Die besten KI-Tools zum Komponieren von Melodien für Songentwürfe
Die besten KI-Tools zum Komponieren von Melodien für Songentwürfe

2026 Neueste Besten Top-Bewerteten KI-Melodie-Schreibtools für Songentwürfe! XIX.AI hat eine hochleistungsfähige, bahnbrechende Kollektion zusammengestellt, die strengen Praxistests unterzogen wurde, um das beste Schreiberlebnis zu liefern. Sie finden detaillierte kostenlose versus kostenpflichtige Vergleiche, präzise Ranglisten und unbedingt auszuprobierende Optionen, die darauf ausgelegt sind, Ihnen zu helfen, beeindruckende Songentwürfe mühelos zu erstellen und Ihre kreative Produktivität erheblich zu steigern. Entdecken Sie jetzt Ihr perfektes Tool!

8 Tools
xix.ai
Chatbot Die besten KI-gestützten Gesprächstrainingstools für Vorstellungsgesprächspraxis
Die besten KI-gestützten Gesprächstrainingstools für Vorstellungsgesprächspraxis

2026 Neueste Besten Top-bewerteten KI-Konversationstrainer-Tools für Vorstellungsgesprächspraxis sind hier auf XIX.AI! Diese kuratierte Sammlung enthält leistungsstarke, bahnbrechende Tools, die strengen Praxistests unterzogen wurden, um präzises Feedback zu liefern. Sie finden einen Vergleich zwischen kostenlosen und kostenpflichtigen Optionen sowie detaillierte Rankings, die Ihnen helfen, die empfehlenswerte Option zu wählen, die Ihr Selbstvertrauen und Ihre Fähigkeiten verbessert. Entdecken Sie jetzt Ihr perfektes Tool für den Erfolg im Vorstellungsgespräch!

12 Tools
xix.ai
Design & Kunst Die besten KI-Tools für den Stiltransfer für kreative Experimente
Die besten KI-Tools für den Stiltransfer für kreative Experimente

Die besten und am besten bewerteten KI-Tools für den Stiltransfer im Jahr 2026 – ideal für kreative Experimente! XIX.AI hat eine leistungsstarke, bahnbrechende Sammlung unverzichtbarer Tools zusammengestellt, die in Praxistests und strengen Bewertungen außergewöhnliche Ergebnisse liefern. Diese Top-Lösungen helfen Kreativen dabei, ihre Produktivität deutlich zu steigern, indem sie die Erstellung von Inhalten beschleunigen und unendliche kreative Möglichkeiten eröffnen. Entdecken Sie jetzt Ihr perfektes Tool und legen Sie noch heute los!

9 Tools
xix.ai
Comic-Erstellung Die besten KI-Tools für Sprechblasen zum visuellen Geschichtenerzählen
Die besten KI-Tools für Sprechblasen zum visuellen Geschichtenerzählen

Die besten und am besten bewerteten KI-Tools für Sprechblasen zum visuellen Storytelling des Jahres 2026 finden Sie hier auf XIX.AI! Diese sorgfältig zusammengestellte Sammlung umfasst leistungsstarke, bahnbrechende Tools, die Kreativen dabei helfen, ihre Produktivität zu steigern und kreative Blockaden zu überwinden. Holen Sie sich einen Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten, sehen Sie sich Praxistests an und werfen Sie einen Blick auf die aktuellen Rankings, um die unverzichtbaren Lösungen zu finden, die sich perfekt für die Gestaltung fesselnder visueller Erzählungen eignen. Stöbern Sie jetzt und entdecken Sie Ihr ideales Tool!

10 Tools
xix.ai
Besprechungsassistent Die besten Tools zur Zusammenfassung von KI-Meetings: Entscheidungen und Folgemaßnahmen übersichtlich nachverfolgen
Die besten Tools zur Zusammenfassung von KI-Meetings: Entscheidungen und Folgemaßnahmen übersichtlich nachverfolgen

Die besten und am besten bewerteten KI-Tools zur Zusammenfassung von Besprechungen im Jahr 2026 für eine übersichtliche Nachverfolgung von Entscheidungen und müheloses Follow-up. Diese sorgfältig zusammengestellte Liste präsentiert leistungsstarke, bahnbrechende Lösungen, die die Produktivität drastisch steigern, indem sie Besprechungsnotizen automatisieren, wichtige Aktionspunkte identifizieren und die Teamkoordination projektübergreifend optimieren. Erhalten Sie einen Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten sowie Praxistests und wöchentlich aktualisierte Rankings, die Ihnen helfen, das perfekte Tool zu finden. Entdecken Sie es jetzt und nutzen Sie Ihren KI-Vorteil!

9 Tools
xix.ai
Datenanalyse Die besten Tools für die KI-gestützte Datenreinigung: Fehlende Werte und Duplikate schnell beheben
Die besten Tools für die KI-gestützte Datenreinigung: Fehlende Werte und Duplikate schnell beheben

2026 – Die neuesten, besten und am höchsten bewerteten Tools für die Reinigung von KI-Daten, um fehlende Werte sowie Duplikate schnell zu beheben. Diese sorgfältig zusammengestellte Liste präsentiert leistungsstarke Lösungen, die die Produktivität erheblich steigern. Jedes Tool wurde in der Praxis gründlich getestet, um seine Zuverlässigkeit zu gewährleisten. Holen Sie sich einen kostenlosen Vergleich zwischen kostenloser und kostenpflichtiger Variante und entdecken Sie das für Ihre Bedürfnisse beste Tool. Entdecken Sie es jetzt auf XIX.AI, um Ihren Vorteil in der KI-Branche zu erlangen.

11 Tools
xix.ai
Kommentare (62)
0/500
DavidGreen
DavidGreen 17. Juni 2026 10:00:23 MESZ

I mean, benchmarks are just a snapshot—does anyone really trust them when companies train models specifically to ace them? 🤔 Might be better to focus on real-world performance rather than chasing numbers on a leaderboard.

JonathanDavis
JonathanDavis 19. August 2025 08:26:53 MESZ

AI benchmarks are getting so hyped, but are they even reliable yet? 🤔 Feels like companies just cherry-pick numbers to flex. I’d rather see real-world use cases than some random leaderboard scores.

EdwardWalker
EdwardWalker 19. August 2025 07:00:59 MESZ

AI benchmarks are getting so hyped, but are they even reliable yet? Feels like we're chasing numbers instead of real progress. 🤔 What do you all think—should we just ignore them for now?

HarrySmith
HarrySmith 11. August 2025 21:00:59 MESZ

AI benchmarks are cool, but are they just tech flexing? I’d rather see real-world uses than numbers on a chart. 🤔

BillyLewis
BillyLewis 4. August 2025 08:01:00 MESZ

AI benchmarks sound cool, but are they just overhyped numbers? I’m curious if they really tell us anything useful about real-world performance. 🧐

JimmyWilson
JimmyWilson 1. August 2025 04:48:18 MESZ

AI benchmarks sound fancy, but are they just tech flexing? I mean, cool numbers, but do they really tell us how AI vibes in the real world? 🤔

OR