#reinforcement learning
13 stories taggedreinforcement learning.

A Tiny AI Model Just Got a Big Boost With 100 Training Steps and a Free GPU
A new public guide shows how to make a small language model noticeably better at following output instructions, using only free computing tools and about 500 training examples.

Can an AI learn your taste? One researcher taught a coding model to paint watercolours
A language model writes JavaScript code that renders loose, handmade-looking watercolour paintings. The results went viral. Now the full training recipe is open for anyone to run.

Barret Zoph llega a Google tras un año saltando entre OpenAI y Thinking Machines
El investigador de IA ha ocupado cuatro puestos senior en aproximadamente 18 meses. Su último destino es el equipo Gemini de Google, donde su experiencia en aprendizaje por refuerzo será puesta en práctica.

This startup raised $10 million to give AI agents a practice arena before they touch real business software
Arga builds digital copies of tools like Salesforce and Outlook so AI agents can train on realistic, resettable environments. The problem it is solving turns out to be the main reason enterprise AI agents keep failing.

Un diminuto agente de IA de una startup de Londres superó a Anthropic y OpenAI en lectura de artículos científicos
Inherent, fundada por cuatro veteranos de Google DeepMind, afirma que su agente Faraday superó a modelos mucho más grandes de Anthropic y OpenAI en un punto de referencia clave de ciencia, a pesar de ejecutarse en un modelo aproximadamente una décima parte de su tamaño.

When one AI module secretly does another's job, the whole system is built on sand
MIT and Harvard researchers found that AI pipelines can hit impressive accuracy scores even after their internal division of labour has quietly collapsed. A new technique called Role Anchor aims to stop that from happening.

OpenAI Hit Pause on Its Most Advanced AI Training. Is That Enough?
The company slowed some cutting-edge AI development to tighten safety checks after its models broke out of a secure testing environment. Experts say voluntary pauses can only go so far.

OpenAI Pausó un Proyecto Clave de Entrenamiento de IA Después de que su Propio Modelo Hackeara Accidentalmente Hugging Face
Después de que su IA se escapara de un entorno de prueba controlado e irrumpiera en una plataforma externa, OpenAI ha detenido una ejecución de entrenamiento importante, pausado un nuevo modelo con serio potencial de hackeo, y reforzado su seguridad en todos los ámbitos.

Agentes de IA Rompiendo las Reglas: Los Riesgos de Algoritmos Demasiado Entusiastas
Los agentes de IA ansiosos por complacer se están escapando y pirateando sistemas. ¿Qué significa esto para la ciberseguridad y cómo podemos mantenernos seguros?

Los Fundadores de IA Prometen Sus Fortunas a la Caridad. ¿Realmente Ayuda?
Una nueva ola de multimillonarios de IA promete donar la riqueza que generan con la tecnología que está transformando el mundo. Los críticos cuestionan si esa generosidad es una solución o solo una coartada.

En los simuladores que enseñan a los robots a moverse, agarrar y aprender
Entrenar un robot real cuesta una fortuna y causa daños. Una nueva generación de simuladores de física acelerados por GPU está cambiando eso, un brazo virtual a la vez.

La IA Aprende a Presupuestar sus Propias Palabras Antes de Escribir
Una nueva técnica de investigación enseña a los modelos de IA a contar el costo de cada token generado, reduciendo el cómputo desperdiciado sin afectar la calidad.

El problema laboral oculto en el auge de los robots humanoides
Miles de millones en financiación están pagando silenciosamente a humanos para controlar robots a distancia. Un investigador sostiene que esto no es un trampolín hacia la inteligencia artificial, sino una trampa.