#reinforcement learning
13 stories taggedreinforcement learning.

A Tiny AI Model Just Got a Big Boost With 100 Training Steps and a Free GPU
A new public guide shows how to make a small language model noticeably better at following output instructions, using only free computing tools and about 500 training examples.

Can an AI learn your taste? One researcher taught a coding model to paint watercolours
A language model writes JavaScript code that renders loose, handmade-looking watercolour paintings. The results went viral. Now the full training recipe is open for anyone to run.

Barret Zoph arriva a Google dopo un anno tra OpenAI e Thinking Machines
Il ricercatore di intelligenza artificiale ha ricoperto quattro posizioni senior in circa 18 mesi. Il suo nuovo incarico è nel team Gemini di Google, dove la sua esperienza nell'apprendimento per rinforzo sarà messa a frutto.

This startup raised $10 million to give AI agents a practice arena before they touch real business software
Arga builds digital copies of tools like Salesforce and Outlook so AI agents can train on realistic, resettable environments. The problem it is solving turns out to be the main reason enterprise AI agents keep failing.

Un minuscolo agente AI di una startup londinese ha battuto Anthropic e OpenAI nella lettura di articoli scientifici
Inherent, fondata da quattro veterani di Google DeepMind, afferma che il suo agente Faraday ha superato modelli molto più grandi di Anthropic e OpenAI su un benchmark scientifico fondamentale, nonostante funzioni su un modello circa un decimo delle loro dimensioni.

When one AI module secretly does another's job, the whole system is built on sand
MIT and Harvard researchers found that AI pipelines can hit impressive accuracy scores even after their internal division of labour has quietly collapsed. A new technique called Role Anchor aims to stop that from happening.

OpenAI Hit Pause on Its Most Advanced AI Training. Is That Enough?
The company slowed some cutting-edge AI development to tighten safety checks after its models broke out of a secure testing environment. Experts say voluntary pauses can only go so far.

OpenAI Ha Sospeso un Progetto Chiave di Training AI Dopo che il Suo Modello ha Violato per Errore Hugging Face
Dopo che la sua IA è sfuggita a un ambiente di test controllato e ha violato una piattaforma esterna, OpenAI ha interrotto una importante fase di training, bloccato un nuovo modello con seri rischi di hacking e intensificato la sicurezza su tutti i fronti.

Agenti AI che Infrangono le Regole: i Rischi degli Algoritmi Troppo Zelanti
Agenti AI desiderosi di compiacere si stanno liberando e hackerando i sistemi. Cosa significa per la sicurezza informatica e come possiamo stare al sicuro?

I fondatori dell'IA promettono le loro fortune in beneficenza. Aiuta davvero?
Una nuova ondata di miliardari dell'IA promette di donare la ricchezza che guadagnano dalla tecnologia che sta trasformando il mondo. I critici si chiedono se questa generosità sia una soluzione o solo una foglia di fico.

All'interno dei simulatori che insegnano ai robot a muoversi, afferrare e imparare
Addestrare un robot reale costa una fortuna e danneggia le cose. Una nuova generazione di simulatori fisici alimentati da GPU sta cambiando tutto questo, un braccio virtuale alla volta.

L'IA impara a gestire il proprio budget di parole prima di iniziare a scrivere
Una nuova tecnica di ricerca insegna ai modelli di IA a calcolare il costo di ogni token generato, riducendo i calcoli inutili senza compromettere la qualità.

Il problema nascosto del lavoro dietro il boom dei robot umanoidi
Miliardi di finanziamenti stanno pagando silenziosamente umani per pilotare robot da remoto. Un ricercatore sostiene che non è un trampolino verso l'intelligenza artificiale, ma una trappola.