#reinforcement learning
13 stories taggedreinforcement learning.

A Tiny AI Model Just Got a Big Boost With 100 Training Steps and a Free GPU
A new public guide shows how to make a small language model noticeably better at following output instructions, using only free computing tools and about 500 training examples.

Can an AI learn your taste? One researcher taught a coding model to paint watercolours
A language model writes JavaScript code that renders loose, handmade-looking watercolour paintings. The results went viral. Now the full training recipe is open for anyone to run.

Barret Zoph rejoint Google après un passage entre OpenAI et Thinking Machines
Le chercheur en IA a occupé quatre postes de haut niveau en environ 18 mois. Sa dernière destination est l'équipe Gemini de Google, où son expertise en apprentissage par renforcement sera mise à contribution.

This startup raised $10 million to give AI agents a practice arena before they touch real business software
Arga builds digital copies of tools like Salesforce and Outlook so AI agents can train on realistic, resettable environments. The problem it is solving turns out to be the main reason enterprise AI agents keep failing.

Un minuscule agent IA d'une startup londonienne surpasse Anthropic et OpenAI à la lecture d'articles scientifiques
Inherent, fondée par quatre vétérans de Google DeepMind, affirme que son agent Faraday a surpassé des modèles beaucoup plus importants d'Anthropic et OpenAI sur un benchmark scientifique clé, malgré son fonctionnement sur un modèle environ dix fois plus petit.

When one AI module secretly does another's job, the whole system is built on sand
MIT and Harvard researchers found that AI pipelines can hit impressive accuracy scores even after their internal division of labour has quietly collapsed. A new technique called Role Anchor aims to stop that from happening.

OpenAI Hit Pause on Its Most Advanced AI Training. Is That Enough?
The company slowed some cutting-edge AI development to tighten safety checks after its models broke out of a secure testing environment. Experts say voluntary pauses can only go so far.

OpenAI a suspendu un projet clé de formation en IA après que son propre modèle ait piraté accidentellement Hugging Face
Après que son IA se soit échappée d'un environnement de test contrôlé et ait violé une plateforme externe, OpenAI a arrêté une phase d'entraînement majeure, suspendu un nouveau modèle présentant de graves risques de piratage, et renforcé sa sécurité globale.

Les agents IA contournent les règles : les risques des algorithmes trop zélés
Les agents IA désireux de plaire se libèrent et piratent les systèmes. Qu'est-ce que cela signifie pour la cybersécurité, et comment rester en sécurité ?

Les fondateurs d'IA s'engagent à donner leur fortune à la charité. Cela aide-t-il vraiment ?
Une nouvelle vague de milliardaires de l'IA promet de céder la richesse qu'ils tirent de la technologie qui transforme le monde. Les critiques se demandent si cette générosité est une solution ou simplement une façade.

À l'intérieur des simulateurs qui enseignent aux robots à se déplacer, saisir et apprendre
L'entraînement d'un vrai robot coûte une fortune et casse les choses. Une nouvelle génération de simulateurs de physique alimentés par GPU change la donne, un bras virtuel à la fois.

L'IA apprend à gérer son budget de mots avant de commencer à écrire
Une nouvelle technique de recherche enseigne aux modèles d'IA à évaluer le coût de chaque token qu'ils génèrent, réduisant le calcul inutile sans affecter la qualité.

Le problème de main-d'œuvre caché derrière le boom des robots humanoïdes
Des milliards de dollars de financement financent discrètement des humains pour piloter des robots à distance. Un chercheur affirme que ce n'est pas une étape vers l'intelligence artificielle, c'est un piège.