Option
Heim
Nachricht
Optimierung der Auswahl von KI-Modellen für reale Leistung

Optimierung der Auswahl von KI-Modellen für reale Leistung

11. August 2025
152

Unternehmen müssen sicherstellen, dass ihre anwendungstreibenden KI-Modelle in realen Szenarien effektiv funktionieren. Die Vorhersage dieser Szenarien kann herausfordernd sein und Bewertungen erschweren. Der aktualisierte RewardBench 2-Benchmark bietet Organisationen klarere Einblicke in die praktische Leistung eines Modells.

Das Allen Institute for AI (Ai2) hat RewardBench 2 eingeführt, eine verbesserte Version seines RewardBench-Benchmarks, der entwickelt wurde, um eine umfassende Bewertung der Modellleistung und Ausrichtung auf Unternehmensziele zu bieten.

Ai2 entwickelte RewardBench mit Klassifikationsaufgaben, die Korrelationen über Inferenzzeit-Berechnungen und nachgelagertes Training bewerten. RewardBench konzentriert sich auf Belohnungsmodelle (RMs), die die Ausgaben großer Sprachmodelle bewerten, indem sie Punktzahlen oder „Belohnungen“ vergeben, um Reinforcement Learning mit menschlichem Feedback (RHLF) zu steuern.

RewardBench 2 ist da! Wir haben lange gelernt aus unserem ersten Belohnungsmodell-Bewertungstool, um eines zu entwickeln, das deutlich schwieriger ist und stärker mit nachgelagertem RLHF und Inferenzzeit-Skalierung korreliert. pic.twitter.com/NGetvNrOQV

— Ai2 (@allen_ai) 2. Juni 2025

Nathan Lambert, ein leitender Forschungswissenschaftler bei Ai2, sagte VentureBeat, dass der ursprüngliche RewardBench zunächst gut funktionierte, aber sich entwickelnde Modellumgebungen aktualisierte Benchmarks erforderten.

„Da Belohnungsmodelle ausgefeilter wurden und Anwendungsfälle komplexer, sahen wir zusammen mit der Gemeinschaft, dass die erste Version die Komplexitäten menschlicher Präferenzen in der realen Welt nicht vollständig abdeckte“, erklärte er.

Lambert betonte, dass RewardBench 2 den Bewertungsumfang und die Tiefe verbessert, indem es vielfältige, herausfordernde Eingaben und verfeinerte Methoden integriert, um menschliche Urteile über KI-Ausgaben besser widerzuspiegeln. Es umfasst neue menschliche Eingaben, ein härteres Bewertungssystem und zusätzliche Domänen.

Nutzung von Bewertungen für die Modellbeurteilung

Belohnungsmodelle bewerten die Modellleistung, aber die Ausrichtung auf Unternehmenswerte ist entscheidend. Nicht ausgerichtete RMs können Probleme wie Halluzinationen verstärken, die Verallgemeinerung reduzieren oder schädliche Antworten während des Feinabstimmens und Reinforcement Learnings übermäßig begünstigen.

RewardBench 2 umfasst sechs Domänen: Faktenhaltigkeit, präzise Befolgen von Anweisungen, Mathematik, Sicherheit, Fokus und Gleichstand.

„Unternehmen können RewardBench 2 auf zwei Arten je nach ihren Bedürfnissen nutzen. Für RLHF sollten sie Best Practices und Datensätze von Top-Modellen in ihre Pipelines integrieren, da Belohnungsmodelle ein On-Policy-Training erfordern. Für Inferenzzeit-Skalierung oder Datenfilterung hilft RewardBench 2, das beste Modell für ihre Domäne mit korrelierter Leistung auszuwählen“, sagte Lambert.

Lambert betonte, dass Benchmarks wie RewardBench Nutzern ermöglichen, Modelle basierend auf ihren wichtigsten Prioritäten zu bewerten, anstatt auf eine generische Punktzahl. Er merkte an, dass die Leistung subjektiv ist, stark an den Nutzerkontext und die Ziele gebunden, wobei menschliche Präferenzen oft sehr nuanciert sind.

Ai2 brachte den ursprünglichen RewardBench im März 2024 auf den Markt und nannte ihn den ersten Benchmark und Leaderboard für Belohnungsmodelle. Seitdem sind neue Methoden wie Meta’s FAIR reWordBench und DeepSeek’s Self-Principled Critique Tuning für intelligentere, skalierbare RMs entstanden.

Super begeistert, dass unsere zweite Belohnungsmodell-Bewertung veröffentlicht ist. Sie ist deutlich schwieriger, viel sauberer und gut korreliert mit nachgelagertem PPO/BoN Sampling.

Frohes Hillclimbing!

Herzlichen Glückwunsch an @saumyamalik44, die das Projekt mit vollem Einsatz für Exzellenz leitete. https://t.co/c0b6rHTXY5

— Nathan Lambert (@natolambert) 2. Juni 2025

Erkenntnisse zur Modellleistung

Mit RewardBench 2 testete Ai2 sowohl bestehende als auch neu trainierte Modelle, einschließlich Varianten von Gemini, Claude, GPT-4.1 und Llama-3.1, neben Datensätzen und Modellen wie Qwen, Skywork und Tulu.

Die Ergebnisse zeigten, dass größere Belohnungsmodelle aufgrund stärkerer Basismodelle hervorragend abschneiden. Llama-3.1 Instruct-Varianten führten den Benchmark an, wobei Skywork-Daten Fokus und Sicherheit unterstützten und Tulu in Faktenhaltigkeit gut abschnitt.

Ai2 stellte fest, dass RewardBench 2 zwar die multidomänen- und genauigkeitsorientierte Bewertung für Belohnungsmodelle vorantreibt, aber in erster Linie Unternehmen dabei leiten sollte, Modelle auszuwählen, die am besten ihren spezifischen Bedürfnissen entsprechen.

Verwandter Artikel
Inside Details Exposed About Next-Gen Gemini: Strained Computing Power, Internal Teams Disagreed on Development Priorities and Resource Allocation Inside Details Exposed About Next-Gen Gemini: Strained Computing Power, Internal Teams Disagreed on Development Priorities and Resource Allocation Berichten zufolge wurde der Start des hocherwarteten Next-Generation-Gemini-Modells von Google verschoben. Interne Uneinigkeiten über Entwicklungsprioritäten und Ressourcenallokation, kombiniert mit begrenzter Rechenkapazität und komplexen Genehmigun
OpenAI entkräftet Bedenken bezüglich des verlangsamen Wachstums und erklärt, dass mehrere Geschäftsbereiche ihre Expansion beschleunigen OpenAI entkräftet Bedenken bezüglich des verlangsamen Wachstums und erklärt, dass mehrere Geschäftsbereiche ihre Expansion beschleunigen Als Reaktion auf externe Kritik bezüglich des nachlassenden Umsatzwachstums und verpasster interner Zielvorgaben gab der KI-Pionier OpenAI am Dienstag, den 28. April, eine selbstbewusste Erklärung ab. Das Unternehmen präzisierte, dass seine Verbrauch
Alibaba Super Cup: Qwen3.8-Max debütiert mit verbesserten Coding- und Bürotools Alibaba Super Cup: Qwen3.8-Max debütiert mit verbesserten Coding- und Bürotools Alibaba hat offiziell Qwen3.8-Max vorgestellt, ein hochmodernes Foundation-Modell mit 2,4 Billionen Parametern. Diese bedeutende KI-Entwicklung bietet erhebliche Leistungssteigerungen in Kernbereichen wie Programmierung und professionelle Büroaufgabe
Empfehlungen zu verwandten Spezialthemen
Musikkomposition Die besten KI-Tools zum Komponieren von Melodien für Songentwürfe
Die besten KI-Tools zum Komponieren von Melodien für Songentwürfe

2026 Neueste Besten Top-Bewerteten KI-Melodie-Schreibtools für Songentwürfe! XIX.AI hat eine hochleistungsfähige, bahnbrechende Kollektion zusammengestellt, die strengen Praxistests unterzogen wurde, um das beste Schreiberlebnis zu liefern. Sie finden detaillierte kostenlose versus kostenpflichtige Vergleiche, präzise Ranglisten und unbedingt auszuprobierende Optionen, die darauf ausgelegt sind, Ihnen zu helfen, beeindruckende Songentwürfe mühelos zu erstellen und Ihre kreative Produktivität erheblich zu steigern. Entdecken Sie jetzt Ihr perfektes Tool!

8 Tools
xix.ai
Chatbot Die besten KI-gestützten Gesprächstrainingstools für Vorstellungsgesprächspraxis
Die besten KI-gestützten Gesprächstrainingstools für Vorstellungsgesprächspraxis

2026 Neueste Besten Top-bewerteten KI-Konversationstrainer-Tools für Vorstellungsgesprächspraxis sind hier auf XIX.AI! Diese kuratierte Sammlung enthält leistungsstarke, bahnbrechende Tools, die strengen Praxistests unterzogen wurden, um präzises Feedback zu liefern. Sie finden einen Vergleich zwischen kostenlosen und kostenpflichtigen Optionen sowie detaillierte Rankings, die Ihnen helfen, die empfehlenswerte Option zu wählen, die Ihr Selbstvertrauen und Ihre Fähigkeiten verbessert. Entdecken Sie jetzt Ihr perfektes Tool für den Erfolg im Vorstellungsgespräch!

12 Tools
xix.ai
Design & Kunst Die besten KI-Tools für den Stiltransfer für kreative Experimente
Die besten KI-Tools für den Stiltransfer für kreative Experimente

Die besten und am besten bewerteten KI-Tools für den Stiltransfer im Jahr 2026 – ideal für kreative Experimente! XIX.AI hat eine leistungsstarke, bahnbrechende Sammlung unverzichtbarer Tools zusammengestellt, die in Praxistests und strengen Bewertungen außergewöhnliche Ergebnisse liefern. Diese Top-Lösungen helfen Kreativen dabei, ihre Produktivität deutlich zu steigern, indem sie die Erstellung von Inhalten beschleunigen und unendliche kreative Möglichkeiten eröffnen. Entdecken Sie jetzt Ihr perfektes Tool und legen Sie noch heute los!

9 Tools
xix.ai
Comic-Erstellung Die besten KI-Tools für Sprechblasen zum visuellen Geschichtenerzählen
Die besten KI-Tools für Sprechblasen zum visuellen Geschichtenerzählen

Die besten und am besten bewerteten KI-Tools für Sprechblasen zum visuellen Storytelling des Jahres 2026 finden Sie hier auf XIX.AI! Diese sorgfältig zusammengestellte Sammlung umfasst leistungsstarke, bahnbrechende Tools, die Kreativen dabei helfen, ihre Produktivität zu steigern und kreative Blockaden zu überwinden. Holen Sie sich einen Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten, sehen Sie sich Praxistests an und werfen Sie einen Blick auf die aktuellen Rankings, um die unverzichtbaren Lösungen zu finden, die sich perfekt für die Gestaltung fesselnder visueller Erzählungen eignen. Stöbern Sie jetzt und entdecken Sie Ihr ideales Tool!

10 Tools
xix.ai
Besprechungsassistent Die besten Tools zur Zusammenfassung von KI-Meetings: Entscheidungen und Folgemaßnahmen übersichtlich nachverfolgen
Die besten Tools zur Zusammenfassung von KI-Meetings: Entscheidungen und Folgemaßnahmen übersichtlich nachverfolgen

Die besten und am besten bewerteten KI-Tools zur Zusammenfassung von Besprechungen im Jahr 2026 für eine übersichtliche Nachverfolgung von Entscheidungen und müheloses Follow-up. Diese sorgfältig zusammengestellte Liste präsentiert leistungsstarke, bahnbrechende Lösungen, die die Produktivität drastisch steigern, indem sie Besprechungsnotizen automatisieren, wichtige Aktionspunkte identifizieren und die Teamkoordination projektübergreifend optimieren. Erhalten Sie einen Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten sowie Praxistests und wöchentlich aktualisierte Rankings, die Ihnen helfen, das perfekte Tool zu finden. Entdecken Sie es jetzt und nutzen Sie Ihren KI-Vorteil!

9 Tools
xix.ai
Datenanalyse Die besten Tools für die KI-gestützte Datenreinigung: Fehlende Werte und Duplikate schnell beheben
Die besten Tools für die KI-gestützte Datenreinigung: Fehlende Werte und Duplikate schnell beheben

2026 – Die neuesten, besten und am höchsten bewerteten Tools für die Reinigung von KI-Daten, um fehlende Werte sowie Duplikate schnell zu beheben. Diese sorgfältig zusammengestellte Liste präsentiert leistungsstarke Lösungen, die die Produktivität erheblich steigern. Jedes Tool wurde in der Praxis gründlich getestet, um seine Zuverlässigkeit zu gewährleisten. Holen Sie sich einen kostenlosen Vergleich zwischen kostenloser und kostenpflichtiger Variante und entdecken Sie das für Ihre Bedürfnisse beste Tool. Entdecken Sie es jetzt auf XIX.AI, um Ihren Vorteil in der KI-Branche zu erlangen.

11 Tools
xix.ai
Kommentare (3)
0/500
JeffreyThomas
JeffreyThomas 13. März 2026 21:01:22 MEZ

Como usuario que solo tiene conocimientos básicos, elegir el modelo adecuado es un dolor de cabeza. Este artículo menciona problemas prácticos que son ciertos; a veces, el modelo parece brillar en la prueba, pero en la práctica simplemente falla. Me pregunto si el RewardBench actualizado ayuda a predecir cuándo un modelo se 'descompone' de manera realista. Si las empresas confían demasiado en las métricas, podrían terminar con un fiasco en producción 😅. ¿Habrá herramientas más accesibles para los equipos pequeños?

DonaldGonzález
DonaldGonzález 6. Dezember 2025 23:30:36 MEZ

この記事、実運用でのAIモデルの難しさをしっかり分析してますね。特にリアルワールドでの性能評価の課題は興味深い。AI導入が進む中で、本当に役立つモデル選びができる企業が勝ち残るのかも。ユーザー体験を考えると、ベンチマークだけで選ぶのは危険かもしれない... 😅

CarlMartin
CarlMartin 17. September 2025 08:30:37 MESZ

C'est intéressant, mais j'aimerais voir plus d'exemples concrets sur comment évaluer la performance des modèles en situation réelle. Parfois les benchmarks ne reflètent pas la complexité du terrain 😅

OR