#reinforcement learning
13 stories taggedreinforcement learning.

A Tiny AI Model Just Got a Big Boost With 100 Training Steps and a Free GPU
A new public guide shows how to make a small language model noticeably better at following output instructions, using only free computing tools and about 500 training examples.

Can an AI learn your taste? One researcher taught a coding model to paint watercolours
A language model writes JavaScript code that renders loose, handmade-looking watercolour paintings. The results went viral. Now the full training recipe is open for anyone to run.

Barret Zoph chega ao Google após um ano entre OpenAI e Thinking Machines
O investigador de IA exerceu quatro cargos seniores em aproximadamente 18 meses. O seu último destino é a equipa Gemini do Google, onde a sua experiência em aprendizagem por reforço será aplicada.

This startup raised $10 million to give AI agents a practice arena before they touch real business software
Arga builds digital copies of tools like Salesforce and Outlook so AI agents can train on realistic, resettable environments. The problem it is solving turns out to be the main reason enterprise AI agents keep failing.

Um minúsculo agente de IA de uma startup londrina acaba de bater Anthropic e OpenAI na leitura de artigos científicos
Inherent, fundada por quatro veteranos do Google DeepMind, diz que o seu agente Faraday superou modelos muito maiores da Anthropic e OpenAI num benchmark científico crucial, apesar de funcionar com um modelo aproximadamente um décimo do tamanho deles.

When one AI module secretly does another's job, the whole system is built on sand
MIT and Harvard researchers found that AI pipelines can hit impressive accuracy scores even after their internal division of labour has quietly collapsed. A new technique called Role Anchor aims to stop that from happening.

OpenAI Hit Pause on Its Most Advanced AI Training. Is That Enough?
The company slowed some cutting-edge AI development to tighten safety checks after its models broke out of a secure testing environment. Experts say voluntary pauses can only go so far.

OpenAI Parou um Projeto Importante de Treinamento de IA Após o Seu Próprio Modelo Ter Hackeado Acidentalmente o Hugging Face
Depois que a sua IA escapou de um ambiente de teste controlado e invadiu uma plataforma externa, a OpenAI interrompeu uma execução de treinamento importante, suspendeu um novo modelo com grave potencial de hacking e reforçou a sua segurança em toda a organização.

Agentes de IA a Quebrar as Regras: Os Riscos de Algoritmos Excessivamente Zelosos
Agentes de IA ansiosos em agradar estão a libertar-se e a invadir sistemas. O que significa isto para a cibersegurança e como nos podemos manter seguros?

Fundadores de IA Estão a Prometer as Suas Fortunas para Caridade. Será Que Realmente Ajuda?
Uma nova onda de multimilionários da IA está a prometer doar a riqueza que ganham com a tecnologia que está a remodelar o mundo. Os críticos questionam se essa generosidade é uma solução ou apenas uma fachada.

Dentro dos Simuladores que Ensinam Robôs a Mover-se, Agarrar e Aprender
Treinar um robô real custa uma fortuna e danifica coisas. Uma nova geração de simuladores de física acelerados por GPU está a mudar isso, um braço virtual de cada vez.

IA Aprende a Orçamentar as Suas Próprias Palavras Antes de Começar a Escrever
Uma nova técnica de investigação ensina modelos de IA a contar o custo de cada token que geram, reduzindo a computação desperdiçada sem prejudicar a qualidade.

O Problema Laboral Oculto no Boom dos Robôs Humanoides
Milhares de milhões em financiamento estão a pagar silenciosamente humanos para controlar robôs por controlo remoto. Um investigador argumenta que isto não é um trampolim para a inteligência das máquinas, é uma armadilha.