#reinforcement learning
13 stories taggedreinforcement learning.

A Tiny AI Model Just Got a Big Boost With 100 Training Steps and a Free GPU
A new public guide shows how to make a small language model noticeably better at following output instructions, using only free computing tools and about 500 training examples.

Can an AI learn your taste? One researcher taught a coding model to paint watercolours
A language model writes JavaScript code that renders loose, handmade-looking watercolour paintings. The results went viral. Now the full training recipe is open for anyone to run.

Barret Zoph landet bei Google nach einem Jahr zwischen OpenAI und Thinking Machines
Der KI-Forscher hat in etwa 18 Monaten vier leitende Positionen inne gehabt. Sein neuester Halt ist Googles Gemini-Team, wo seine Expertise in Reinforcement Learning zum Einsatz kommt.

This startup raised $10 million to give AI agents a practice arena before they touch real business software
Arga builds digital copies of tools like Salesforce and Outlook so AI agents can train on realistic, resettable environments. The problem it is solving turns out to be the main reason enterprise AI agents keep failing.

Ein winziger KI-Agent eines Londoner Startups schlägt Anthropic und OpenAI beim Lesen wissenschaftlicher Arbeiten
Inherent, gegründet von vier Google-DeepMind-Veteranen, gibt an, dass sein Faraday-Agent viel größere Modelle von Anthropic und OpenAI bei einem wichtigen Wissenschafts-Benchmark übertroffen hat, obwohl er auf einem Modell läuft, das ungefähr ein Zehntel ihrer Größe ausmacht.

When one AI module secretly does another's job, the whole system is built on sand
MIT and Harvard researchers found that AI pipelines can hit impressive accuracy scores even after their internal division of labour has quietly collapsed. A new technique called Role Anchor aims to stop that from happening.

OpenAI Hit Pause on Its Most Advanced AI Training. Is That Enough?
The company slowed some cutting-edge AI development to tighten safety checks after its models broke out of a secure testing environment. Experts say voluntary pauses can only go so far.

OpenAI stoppte ein wichtiges KI-Trainingsprojekt, nachdem sein eigenes Modell Hugging Face gehackt hatte
Nachdem seine KI aus einer kontrollierten Testumgebung ausbrach und eine externe Plattform kompromittierte, hat OpenAI einen großen Trainingslauf gestoppt, ein neues Modell mit erheblichem Hacking-Potenzial angehalten und seine Sicherheit insgesamt verschärft.

KI-Agenten brechen die Regeln: Die Risiken übereifriger Algorithmen
KI-Agenten, die gefallen möchten, brechen aus und hacken Systeme. Was bedeutet das für die Cybersicherheit und wie bleiben wir sicher?

KI-Gründer versprechen ihre Vermögen der Wohltätigkeit. Hilft das wirklich?
Eine neue Welle von KI-Milliardären verspricht, die Vermögen aus der Technologie, die die Welt verändert, für wohltätige Zwecke zu spenden. Kritiker fragen sich, ob diese Großzügigkeit eine echte Lösung ist oder nur eine Feigenblatt-Strategie.

Inside den Simulatoren, die Robotern das Bewegen, Greifen und Lernen beibringen
Das Training eines echten Roboters kostet ein Vermögen und beschädigt Geräte. Eine neue Generation GPU-gestützter Physik-Simulatoren verändert das – ein virtueller Arm nach dem anderen.

KI lernt, ihre eigenen Worte zu budgetieren, bevor sie schreibt
Eine neue Forschungstechnik lehrt KI-Modelle, die Kosten jedes generierten Tokens zu berechnen und spart unnötige Rechenleistung, ohne die Qualität zu beeinträchtigen.

Das verborgene Arbeitsproblem im Humanoid-Robotik-Boom
Milliarden an Finanzierungen zahlen stillschweigend Menschen dafür, Roboter aus der Ferne zu steuern. Ein Forscher argumentiert, dass dies nicht ein Schritt zur künstlichen Intelligenz ist, sondern eine Falle.