La empresa china de inteligencia artificial Zhipu AI (HKG: 2513) ha lanzado una ofensiva a gran escala con el documento que publicó junto con el lanzamiento de su último modelo GLM-5.3.
La empresa, que opera internacionalmente bajo el nombre de Z.ai, mencionó específicamente a Mythos 5 de Anthropic como uno de los modelos que GLM-5.3 superó en la prueba de rendimiento CyberGym, que mide la capacidad de un modelo para comprobar el código fuente en busca de vulnerabilidades de software.
GLM-5.3 se ejecuta sobre el mismo modelo base que GLM-5.2, un diseño de mezcla de expertos con 743 mil millones de parámetros que activa aproximadamente 40 mil millones de parámetros por token.
Según las cifras difundidas por Z.ai, su GLM-5.3 obtuvo un 84,5% en la prueba de rendimiento CyberGym, lo que supone una ventaja de menos de un punto sobre Mythos 5 de Anthropic (83,8%) y GPT-5.6 Sol de OpenAI (83,6%).
Superar a Mythos podría catapultar a Z.ai al primer puesto para desarrolladores y equipos de seguridad que buscan implementar modelos de código abierto para combatir ataques. La empresa ha declarado que el modelo ya ha detectado más de mil errores graves en software en producción.
En pruebas más exigentes, como ExploitBench y ExploitGym, Z.ai admite que su último modelo se queda atrás respecto a los mejores modelos estadounidenses.
Por ejemplo, en ExploitBench, que pide a un modelo que construya un exploit funcional a partir de vulnerabilidades, GLM-5.3 obtuvo una puntuación del 54,4% frente al 78% de Mythos 5.
Z.ai se ha comprometido a entregar los datos de rendimiento de su nuevo modelo GLM-5.3 a Hugging Face el 28 de agosto. Este es el primer dato de rendimiento de un modelo GLM que se retrasa, y el laboratorio chino de IA cita la evaluación de seguridad y el endurecimiento como razones para la demora de dos semanas.
Más de 100 de las 2436 vulnerabilidades detectadas por el modelo fueron calificadas como críticas tras analizar unos 269 proyectos, incluyendo software utilizado en el kernel de Linux, WinRAR, Redis y FFmpeg. Según se informa, la vulnerabilidad más antigua había pasado desapercibida durante 45 años.
Hasta entonces, solo los suscriptores de pago del Plan de Codificación Z.ai o de su plataforma ZCode podrán utilizarlo.
Todas las cifras anteriores provienen del anuncio de Z.ai, no de unadent independiente. Incluso las pruebas de rendimiento públicas fueron ejecutadas por Z.ai con su propia configuración, por lo que el Code Bench interno no puede ser auditado fuera de la empresa.
independientesdent como Artificial Analysis, aún no han incorporado el modelo según este Cryptopolitan .
El lanzamiento coincide además con un ejemplo real de lo que está en juego. El modelo GLM-5.2 de Z.ai fue el que Hugging Face utilizó después de que los sistemas de prueba de OpenAI, ejecutados con medidas de seguridad reducidas, escaparan de un entorno aislado y comprometieran sus servidores.
En materia geopolítica, Zhipu adoptó un tono cooperativo, declarando a los periodistas que la IA "no debería ser una actuación en solitario de una sola nación, sino una sinfonía de colaboración global"
Las mentes más brillantes del mundo de las criptomonedas ya leen nuestro boletín. ¿Te apuntas? ¡ Únete!