Heim
Baidu Wenyin stellt PaddleOCR-VL-1.6 vor, das eine Genauigkeit von 96,33 % erreicht und einen neuen SOTA-Wert bei der Dokumentenauswertung erzielt

Baidu hat PaddleOCR-VL-1.6, eine spezialisierte Variante des ERNIE Large Model, offiziell auf den Markt gebracht. Im maßgeblichen OmnicDocBench v1.6-Benchmark erzielte es eine Genauigkeitsrate von 96,33 % und übertraf damit führende Modelle wie Gemini-3-Pro, GPT-5.2 und GLM-OCR. Diese Leistung setzt einen neuen Branchen-SOTA-Standard und belegt weltweit den ersten Platz in der Gesamtleistung, was einen großen Fortschritt darin darstellt, wie multimodale Großmodelle komplexe Dokumente verstehen und reale Kontexte analysieren.
Als Schlüsselelement des multimodalen Ökosystems des ERNIE Large Model baut PaddleOCR auf der ERNIE-Grundlage auf und unterstützt derzeit über 100 Sprachen, womit es Nutzer in mehr als 170 Ländern und Regionen bedient. Das aktualisierte PaddleOCR-VL-1.6 behält eine schlanke 0,9-Milliarden-Architektur bei und verbessert gleichzeitig die zentralen Erkennungsfähigkeiten in anspruchsvollen Szenarien – darunter Tabellen, alte Texte, seltene Zeichen, Siegel und Diagramme – durch einen modellgesteuerten Mechanismus zur Datengenerierung und eine schrittweise Trainingsoptimierung erheblich.
Bei der „Real5-OmniDocBench“-Bewertung, die die Leistung in komplexen realen Umgebungen testet, behielt das Modell mit einer Gesamtpunktzahl von 93,19 % seine Führungsposition. Es meisterte erfolgreich weithin anerkannte Herausforderungen bei der Textanalyse wie gescannte Dokumente, geknickte Seiten, Bildschirmaufnahmen, Lichtschwankungen und schräg stehenden Text.
Dank der bewährten Architektur können Unternehmen und Entwickler nahtlos migrieren, ohne dass zusätzliche Anpassungen erforderlich sind. PaddleOCR hat auf GitHub bereits 79.2K Sterne überschritten und damit Googles Tesseract OCR überholt, um zum weltweit beliebtesten Open-Source-OCR-Projekt zu werden. Das neue Modell ist ab sofort auf der offiziellen Website verfügbar, wobei sowohl der Code als auch die Gewichte als Open Source bereitgestellt werden. Da sich große Modelle zunehmend in Richtung multimodaler Tiefe entwickeln, bietet PaddleOCR-VL-1.6 eine effizientere Lösung auf Industrie-Niveau für die Dokumentendigitalisierung und wird den Einsatz von KI in komplexen multimodalen Anwendungen weiter beschleunigen.
Verwandter Artikel
Anthropic bringt Claude für kleine Unternehmen heraus, ein KI-Fähigkeitspaket für KMUs
Anthropic hat Claude für kleine Unternehmen am Mittwoch offiziell eingeführt und dabei eine Reihe von Automatisierungstools vorgestellt, die speziell für kleine und mittlere Unternehmen (KMU) entwickelt wurden. Diese Initiative zielt darauf ab, techn
Deutsches Forschungskonsortium stellt Open-Source-KI-Modell Soofi vor
Der Deutsche Verein für Künstliche Intelligenz hat offiziell Soofi S30B-A3B veröffentlicht, ein neues Open-Source-Großes Sprachmodell. Dieser Meilenstein fördert Europas souveräne KI-Infrastruktur und belebt den Open-Source-Sektor mit Fokus auf hohe
Toytas Schätzung von 6,4 Milliarden US-Dollar für Robotik rückt Physical AI in den Fokus
Toyota Motor geht davon aus, dass die flächendeckende Einführung der Automatisierung in ihren Fertigungsstätten, Tochtergesellschaften und wichtigsten Zulieferern ab 2028 etwa 400.000 Roboter und jährliche Ausgaben von rund einer Billion Yen (6,4 Mil
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)

Baidu hat PaddleOCR-VL-1.6, eine spezialisierte Variante des ERNIE Large Model, offiziell auf den Markt gebracht. Im maßgeblichen OmnicDocBench v1.6-Benchmark erzielte es eine Genauigkeitsrate von 96,33 % und übertraf damit führende Modelle wie Gemini-3-Pro, GPT-5.2 und GLM-OCR. Diese Leistung setzt einen neuen Branchen-SOTA-Standard und belegt weltweit den ersten Platz in der Gesamtleistung, was einen großen Fortschritt darin darstellt, wie multimodale Großmodelle komplexe Dokumente verstehen und reale Kontexte analysieren.
Als Schlüsselelement des multimodalen Ökosystems des ERNIE Large Model baut PaddleOCR auf der ERNIE-Grundlage auf und unterstützt derzeit über 100 Sprachen, womit es Nutzer in mehr als 170 Ländern und Regionen bedient. Das aktualisierte PaddleOCR-VL-1.6 behält eine schlanke 0,9-Milliarden-Architektur bei und verbessert gleichzeitig die zentralen Erkennungsfähigkeiten in anspruchsvollen Szenarien – darunter Tabellen, alte Texte, seltene Zeichen, Siegel und Diagramme – durch einen modellgesteuerten Mechanismus zur Datengenerierung und eine schrittweise Trainingsoptimierung erheblich.
Bei der „Real5-OmniDocBench“-Bewertung, die die Leistung in komplexen realen Umgebungen testet, behielt das Modell mit einer Gesamtpunktzahl von 93,19 % seine Führungsposition. Es meisterte erfolgreich weithin anerkannte Herausforderungen bei der Textanalyse wie gescannte Dokumente, geknickte Seiten, Bildschirmaufnahmen, Lichtschwankungen und schräg stehenden Text.
Dank der bewährten Architektur können Unternehmen und Entwickler nahtlos migrieren, ohne dass zusätzliche Anpassungen erforderlich sind. PaddleOCR hat auf GitHub bereits 79.2K Sterne überschritten und damit Googles Tesseract OCR überholt, um zum weltweit beliebtesten Open-Source-OCR-Projekt zu werden. Das neue Modell ist ab sofort auf der offiziellen Website verfügbar, wobei sowohl der Code als auch die Gewichte als Open Source bereitgestellt werden. Da sich große Modelle zunehmend in Richtung multimodaler Tiefe entwickeln, bietet PaddleOCR-VL-1.6 eine effizientere Lösung auf Industrie-Niveau für die Dokumentendigitalisierung und wird den Einsatz von KI in komplexen multimodalen Anwendungen weiter beschleunigen.
Anthropic bringt Claude für kleine Unternehmen heraus, ein KI-Fähigkeitspaket für KMUs
Anthropic hat Claude für kleine Unternehmen am Mittwoch offiziell eingeführt und dabei eine Reihe von Automatisierungstools vorgestellt, die speziell für kleine und mittlere Unternehmen (KMU) entwickelt wurden. Diese Initiative zielt darauf ab, techn
Deutsches Forschungskonsortium stellt Open-Source-KI-Modell Soofi vor
Der Deutsche Verein für Künstliche Intelligenz hat offiziell Soofi S30B-A3B veröffentlicht, ein neues Open-Source-Großes Sprachmodell. Dieser Meilenstein fördert Europas souveräne KI-Infrastruktur und belebt den Open-Source-Sektor mit Fokus auf hohe
Toytas Schätzung von 6,4 Milliarden US-Dollar für Robotik rückt Physical AI in den Fokus
Toyota Motor geht davon aus, dass die flächendeckende Einführung der Automatisierung in ihren Fertigungsstätten, Tochtergesellschaften und wichtigsten Zulieferern ab 2028 etwa 400.000 Roboter und jährliche Ausgaben von rund einer Billion Yen (6,4 Mil











