Heim
GLM-5.3 von Zhipu veröffentlicht: 740 Milliarden Parameter unverändert, Leistung um 50 % gesteigert durch Post-Training-Programmierfähigkeiten
Zhipu hat GLM-5.3 offiziell am 14. August vorgestellt und behält dabei die 74 Milliarden Parameter seines Vorgängers GLM-5.2 bei, während es das gerüchteweise geplante Upgrade auf eine Billion Parameter überspringt, das möglicherweise für GLM-5.5 zurückgehalten wird. Durch fortschrittliche Post-Training-Techniken hat Zhipu die Leistung von GLM-5.3 um 50 % gegenüber der vorherigen Generation gesteigert und damit in mehreren gängigen Benchmark-Tests unter den aktuellen Open-Source-Modellen die Spitzenplätze belegt. Seine Fähigkeiten im Bereich Coding und Agenten stehen Claude Opus 4.8 in nichts nach und übertreffen andere inländische Modelle bei der Programmierleistung.
Die wichtigsten Verbesserungen in den Benchmark-Ergebnissen unterstreichen die erweiterten Fähigkeiten des Modells. Im Terminal-Bench 3.0, der die komplexe Aufgabenerledigung in realen Terminalumgebungen bewertet, stieg der Score von 4,6 auf 28,3. In DeepSWE v1.1, das sich auf langfristige Softwareentwicklung und kontinuierliche Codeänderungen konzentriert, verbesserte sich die Leistung von 46,2 auf 66,9. Im Agents’ Last Exam, der verschiedene professionelle Szenarien abdeckt und dabei den Schwerpunkt auf die Zusammenarbeit über verschiedene Tools hinweg sowie auf langfristige Aufgaben legt, erhöhte sich der Score von 23,8 auf 28,5. Darüber hinaus erzielte GLM-5.3 in GDPval-AA v2, das 44 Berufe abdeckt und hochwertige Wissensarbeit bewertet, 1.769 Punkte und demonstrierte damit eine starke Ausführung professioneller Aufgaben, die auf Programmierfähigkeiten basiert. Insgesamt zeigt das Modell erhebliche Fortschritte in der komplexen Softwareentwicklung, der Terminalbedienung und breiteren realen Agentenaufgaben.

Der überzeugendste Beweis stammt von Zhipus eigenem Z.ai Code Bench, einer Evaluierungssuite, die das Modell in eine reale lokale Entwicklungsumgebung stellt, um End-to-End-Aufgaben unter verschiedenen Reasoning-Modi auszuführen und so die Erfahrung der Nutzung eines Coding-Agenten genau nachzuahmen. Die Ergebnisse zeigen, dass GLM-5.3 eine optimale Balance zwischen Effektivität und Token-Effizienz erreicht: Im High-Modus erreichte es eine Genauigkeitsrate von 31,4 %, was Claude Opus 4.8 im Maximalmodus mit 29,5 % übertraf, während es nur etwa 50.000 Token pro Aufgabe durchschnittlich verwendete, im Vergleich zu 120.000 Token bei Opus 4.8. Dies zeigt, dass GLM-5.3 identische Aufgaben mit einem deutlich kürzeren Ausführungspfad erledigen kann.

Was die Produktverfügbarkeit betrifft, so ist GLM-5.3 nun auf Zhipus eigenem Coding-Tool ZCode und dem Produktivitätstool AutoClaw verfügbar und steht allen Nutzern und Abonnenten des GLM Coding Plan offen. Auch Drittanbieter-Coding-Plattformen wie TraeWork, TraeCode, Kousi, WorkBuddy, CodeBuddy, Qoder, QwenWork, CatPaw, JoyCode und OpenCode haben den frühen Zugang gewährt. Die API wird in Kürze gestartet, und die vollständigen Modellgewichte werden innerhalb von zwei Wochen nach notwendigen Sicherheitsverbesserungen open-sourced. Zhipus Strategie konzentriert sich darauf, die potenziellen Angriffsfähigkeiten des Modells zu begrenzen, während sein defensiver Wert erhalten bleibt. Um 13:00 Uhr heute wurden die Kontingente für alle GLM Coding Plan-Nutzer zurückgesetzt, und die Nutzungsstatistiken im Backend spiegeln nun wiederhergestellte Limits für alle wider.
Verwandter Artikel
Tesollo startet IPO-Initiative angesichts der Entwicklung humanoider Hände
Tesollo entwickelt Roboterhände mit hohem Freiheitsgrad, die mit jeder humanoiden Plattform kompatibel sind. | Quelle: TesolloDer Innovator für Roboterhände, Tesollo Inc., hat offiziell die Vorbereitungen für einen Börsengang (IPO) im kommenden Jahr
Prentis, das von Reid Hoffman und Mark Pincus mitgegründete neue KI-Lab, befindet sich in Gesprächen über die Aufnahme von 100 Millionen US-Dollar.
Prentis, ein aufstrebendes KI-Forschungslabor, das sich auf Computer-Use-Modelle spezialisiert hat und von dem mehrfachen Unternehmer Ritankar Das gemeinsam mit erfahrenen Tech-Branchenvertretern Reid Hoffman und Mark Pincus gegründet wurde, verhande
AIR sammelt 50 Millionen US-Dollar ein, um Unternehmen dabei zu helfen, Fähigkeiten und Zusatzmodule zu prüfen, die von KI-Agenten genutzt werden
Während Organisationen KI-Agenten zunehmend Zugriff auf ihre internen Systeme gewähren, entsteht um die Tools, auf die diese Agenten angewiesen sind – Fähigkeiten (Skills), Plugins, MCP-Server und Add-ons, die Internetinteraktionen ermöglichen –, ein
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
Zhipu hat GLM-5.3 offiziell am 14. August vorgestellt und behält dabei die 74 Milliarden Parameter seines Vorgängers GLM-5.2 bei, während es das gerüchteweise geplante Upgrade auf eine Billion Parameter überspringt, das möglicherweise für GLM-5.5 zurückgehalten wird. Durch fortschrittliche Post-Training-Techniken hat Zhipu die Leistung von GLM-5.3 um 50 % gegenüber der vorherigen Generation gesteigert und damit in mehreren gängigen Benchmark-Tests unter den aktuellen Open-Source-Modellen die Spitzenplätze belegt. Seine Fähigkeiten im Bereich Coding und Agenten stehen Claude Opus 4.8 in nichts nach und übertreffen andere inländische Modelle bei der Programmierleistung.
Die wichtigsten Verbesserungen in den Benchmark-Ergebnissen unterstreichen die erweiterten Fähigkeiten des Modells. Im Terminal-Bench 3.0, der die komplexe Aufgabenerledigung in realen Terminalumgebungen bewertet, stieg der Score von 4,6 auf 28,3. In DeepSWE v1.1, das sich auf langfristige Softwareentwicklung und kontinuierliche Codeänderungen konzentriert, verbesserte sich die Leistung von 46,2 auf 66,9. Im Agents’ Last Exam, der verschiedene professionelle Szenarien abdeckt und dabei den Schwerpunkt auf die Zusammenarbeit über verschiedene Tools hinweg sowie auf langfristige Aufgaben legt, erhöhte sich der Score von 23,8 auf 28,5. Darüber hinaus erzielte GLM-5.3 in GDPval-AA v2, das 44 Berufe abdeckt und hochwertige Wissensarbeit bewertet, 1.769 Punkte und demonstrierte damit eine starke Ausführung professioneller Aufgaben, die auf Programmierfähigkeiten basiert. Insgesamt zeigt das Modell erhebliche Fortschritte in der komplexen Softwareentwicklung, der Terminalbedienung und breiteren realen Agentenaufgaben.

Der überzeugendste Beweis stammt von Zhipus eigenem Z.ai Code Bench, einer Evaluierungssuite, die das Modell in eine reale lokale Entwicklungsumgebung stellt, um End-to-End-Aufgaben unter verschiedenen Reasoning-Modi auszuführen und so die Erfahrung der Nutzung eines Coding-Agenten genau nachzuahmen. Die Ergebnisse zeigen, dass GLM-5.3 eine optimale Balance zwischen Effektivität und Token-Effizienz erreicht: Im High-Modus erreichte es eine Genauigkeitsrate von 31,4 %, was Claude Opus 4.8 im Maximalmodus mit 29,5 % übertraf, während es nur etwa 50.000 Token pro Aufgabe durchschnittlich verwendete, im Vergleich zu 120.000 Token bei Opus 4.8. Dies zeigt, dass GLM-5.3 identische Aufgaben mit einem deutlich kürzeren Ausführungspfad erledigen kann.

Was die Produktverfügbarkeit betrifft, so ist GLM-5.3 nun auf Zhipus eigenem Coding-Tool ZCode und dem Produktivitätstool AutoClaw verfügbar und steht allen Nutzern und Abonnenten des GLM Coding Plan offen. Auch Drittanbieter-Coding-Plattformen wie TraeWork, TraeCode, Kousi, WorkBuddy, CodeBuddy, Qoder, QwenWork, CatPaw, JoyCode und OpenCode haben den frühen Zugang gewährt. Die API wird in Kürze gestartet, und die vollständigen Modellgewichte werden innerhalb von zwei Wochen nach notwendigen Sicherheitsverbesserungen open-sourced. Zhipus Strategie konzentriert sich darauf, die potenziellen Angriffsfähigkeiten des Modells zu begrenzen, während sein defensiver Wert erhalten bleibt. Um 13:00 Uhr heute wurden die Kontingente für alle GLM Coding Plan-Nutzer zurückgesetzt, und die Nutzungsstatistiken im Backend spiegeln nun wiederhergestellte Limits für alle wider.
Tesollo startet IPO-Initiative angesichts der Entwicklung humanoider Hände
Tesollo entwickelt Roboterhände mit hohem Freiheitsgrad, die mit jeder humanoiden Plattform kompatibel sind. | Quelle: TesolloDer Innovator für Roboterhände, Tesollo Inc., hat offiziell die Vorbereitungen für einen Börsengang (IPO) im kommenden Jahr
Prentis, das von Reid Hoffman und Mark Pincus mitgegründete neue KI-Lab, befindet sich in Gesprächen über die Aufnahme von 100 Millionen US-Dollar.
Prentis, ein aufstrebendes KI-Forschungslabor, das sich auf Computer-Use-Modelle spezialisiert hat und von dem mehrfachen Unternehmer Ritankar Das gemeinsam mit erfahrenen Tech-Branchenvertretern Reid Hoffman und Mark Pincus gegründet wurde, verhande
AIR sammelt 50 Millionen US-Dollar ein, um Unternehmen dabei zu helfen, Fähigkeiten und Zusatzmodule zu prüfen, die von KI-Agenten genutzt werden
Während Organisationen KI-Agenten zunehmend Zugriff auf ihre internen Systeme gewähren, entsteht um die Tools, auf die diese Agenten angewiesen sind – Fähigkeiten (Skills), Plugins, MCP-Server und Add-ons, die Internetinteraktionen ermöglichen –, ein











