El Holo4 de H Company Maneja Todas las Interfaces que Ofrece una Computadora, en un Modelo

Holo4 puede hacer clic en menús, escribir código y llamar APIs dentro de una sola tarea. Para empresas que evalúan costos de agentes, esa amplitud en una escala menor es la verdadera historia.

AI2Day NewsdeskEditor: Lee Brown3 min read
A desktop computer screen displaying multiple open software windows simultaneously, including a 3D modeling application, a code editor, and a web browser, photo
Share

Puntos clave

  • El modelo de 27B de Holo4 obtiene un 61,7% en OSWorld 2.0, un punto de referencia para tareas de control de computadora, quedando solo por debajo de los modelos cerrados más grandes mientras utiliza muchos menos recursos informáticos.
  • A diferencia de la mayoría de agentes de IA, Holo4 cambia entre interfaces gráficas, ejecución de código y APIs de software dentro de una sola tarea sin cambiar de modelo.
  • H Company está publicando cada ejecución grabada detrás de sus puntuaciones de referencia para que cualquiera pueda reproducirlas y verificarlas.
  • El lanzamiento también incluye Holotron4 Nano, basado en la base Nvidia Nemotron Nano Omni, extendiendo el mismo entrenamiento de agentes a un modelo más pequeño y económico.

La mayoría de los agentes de IA, los programas de software que realizan tareas multietapa en una computadora sin entrada humana constante, tienen un conjunto de habilidades limitado. Un modelo entrenado para hacer clic a través de menús gráficos se queda en blanco cuando no hay pantalla para mirar. Uno entrenado para llamar APIs de software, las conexiones codificadas que permiten que los programas se comuniquen entre sí, se atasca frente a una aplicación que no tiene tales conexiones. El trabajo de oficina real no respeta esos límites.

El Holo4 de H Company, lanzado esta semana e informado primero por Hugging Face, viene en dos versiones: un modelo de 27 mil millones de parámetros y uno de 35 mil millones de parámetros utilizando un diseño Mixture of Experts, donde solo parte del modelo se activa para cualquier tarea dada. Ambas están disponibles a través de la propia API de H Company.

¿Qué hace exactamente Holo4?

Maneja las cuatro formas principales en que el software se expone: interfaces gráficas de apuntar y hacer clic, código escrito, herramientas MCP (un estándar que permite que los modelos de IA llamen servicios externos) y APIs de software directo. Una tarea puede requerir las cuatro, y Holo4 se mueve entre ellas sin necesidad de ser reconfigurado.

H Company demostró esto con dos tareas. Construir un modelo 3D detallado de la Torre Eiffel en software de ingeniería requirió 84 llamadas de agente y 1,3 millones de tokens de procesamiento. Un juego de Pac-Man que se juega a sí mismo requirió 68 llamadas y 2,4 millones de tokens. La misma tarea de Pac-Man dada a Qwen3.8 27B, el modelo base en el que se entrenó Holo4, necesitó 197 llamadas y 11,4 millones de tokens. Menos pasos y menos tokens significa menor costo por tarea.

¿Cómo se compara con los grandes actores?

En OSWorld 2.0, Holo4 27B obtiene 61,7%. El Opus 5.5 de Anthropic obtiene 81,8%. Esa brecha importa. Pero Holo4 alcanza su puntuación con una fracción de los parámetros y un precio más bajo por ejecución, que es la comparación práctica para una empresa decidiendo qué implementar.

Modelo Puntuación OSWorld 2.0 Tipo
Opus 5.5 81,8% Cerrado, grande
GPT-5.6 Sol 66,2% Cerrado, grande
Holo4 27B 61,7% Abierto, pequeño
Holo4 35B-A3B 30,9% Abierto, MoE

Los subconjuntos de tareas y configuraciones de evaluación difieren en estos resultados, por lo que los números son indicativos, no una carrera controlada.

Lo que H Company hace con sus puntuaciones importa tanto como las puntuaciones mismas. Cada ejecución de agente grabada detrás de sus números de referencia públicos se publica y es reproducible en trajectories.hcompany.ai o descargable desde Hugging Face. El 22 de septiembre informamos que el Instituto de Seguridad de IA del gobierno del Reino Unido tomó un paso similar, publicando resultados de pruebas verificados bajo un estándar abierto para que los investigadores pudieran repetir el trabajo. Un laboratorio que publica registros de ejecución completos sigue siendo la excepción.

¿Debería preocuparse por si estos resultados se sostienen?

El entrenamiento utilizó aproximadamente 10 000 tareas construidas por un pipeline interno que H Company llama Agentic Task Factory, que genera tareas verificables a partir de documentación de software y capturas de pantalla. H Company también reconstruyó su bucle de control, el software que retroalimenta las acciones del modelo al entorno durante cientos de pasos y rastrea la tarea en todo ese período.

Para trabajadores cuyos empleadores están evaluando agentes de IA, la pregunta práctica es si un modelo entrenado en tareas amplias de uso de computadora se sostiene con su software específico. Los registros de ejecución abiertos permiten al personal técnico verificar las afirmaciones de referencia en lugar de aceptarlas por fe. Eso vale más que cualquier puntuación individual.

© 2026 AI2Day