Microsoft bündelt Copilot, OpenAI zählt Agenten-Vorfälle und Claude entdeckt ein Enzymsystem
Vorsprung mit KI

In dieser Ausgabe

AI-Agenten verlassen den Chat - und treffen jetzt Entscheidungen in Software, Forschung und fremden Systemen.

Guten Morgen KI Freunde, Microsoft baut Copilot vom Chatbot zum Arbeitsbetriebssystem aus. OpenAI untersucht parallel eine wachsende Zahl unerwünschter Agenten-Aktivitäten. Und Claude hat in einer autonomen Forschungsphase ein bislang unbekanntes Enzymsystem gefunden.

Die gemeinsame Entwicklung: AI beantwortet nicht mehr nur Fragen. Sie plant, nutzt Werkzeuge, arbeitet über Stunden und verändert reale Systeme. Damit werden Zugriffsrechte, Protokolle und menschliche Freigaben genauso wichtig wie die Qualität des Models.

Top News
Microsofts neuer Copilot mit Home, Code und Autopilot
Bildquelle: Microsoft

Microsoft macht Copilot mit Home, Code und Autopilot zur Arbeitszentrale

Kurz gesagt

Microsoft bündelt Chats, Dokumentarbeit, App-Bau und lang laufende Aufgaben in einer neuen Copilot-Oberfläche. Der Schritt verschiebt Copilot vom einzelnen Assistenten zum zentralen Einstiegspunkt für Arbeit.

Details

  • Home vereint Chat und Cowork und soll Inhalte aus Word, Excel und PowerPoint direkt einbeziehen.
  • Code erstellt Apps und Automationen aus natürlicher Sprache und nutzt Technologie aus GitHub Copilot.
  • Autopilot ist als dauerhafter Agent gedacht, der Aufgaben weiterbearbeitet, während der Nutzer nicht am Rechner sitzt. Eine private Preview soll Ende September starten.

Warum das wichtig ist

Microsoft kontrolliert bereits Identitäten, Dokumente und Unternehmensprozesse. Wenn Copilot zur Oberfläche über diesem Stack wird, entscheidet nicht nur Model-Qualität über den Erfolg, sondern der direkte Zugang zur täglichen Arbeit.

Was du mitnehmen solltest

Prüfe bei jedem Agenten drei Dinge: Welche Daten darf er sehen, welche Aktionen darf er selbst ausführen und wann muss ein Mensch freigeben?

OpenAI-Logo vor einem Bildschirm
Bildquelle: Reuters

OpenAI untersucht rund zwei Dutzend unerwünschte Agenten-Vorfälle

Kurz gesagt

OpenAI versucht laut Reuters, den Umfang mehrerer unerwünschter Aktivitäten autonomer Agents zu verstehen. In einem Fall sollen 53 Bilder von ChatGPT-Nutzern offengelegt worden sein.

Details

  • Reuters berichtet von ungefähr zwei Dutzend Fällen, in denen Agents unerwünschte Aktionen ausführten; die Aufarbeitung könne Monate dauern.
  • OpenAI teilte mit, öffentliche Informationen von Behörden-Websites seien abgerufen worden. Das Unternehmen habe aber keine kompromittierten Konten oder unbefugten Systemzugriffe festgestellt.
  • Ein eigener Melderahmen beschreibt zusätzlich Fälle mit öffentlich geteilten Dateien und von Agents hochgeladenen Inhalten.

Warum das wichtig ist

Ein Chatfehler bleibt oft im Fenster. Ein Agentenfehler kann Dateien veröffentlichen, Websites verändern oder Daten an Dritte senden. Mehr Autonomie vergrößert deshalb nicht nur den Nutzen, sondern auch die mögliche Schadensfläche.

Was du mitnehmen solltest

Starte Agents mit minimalen Rechten, protokolliere jede externe Aktion und verlange Freigaben vor Uploads, Veröffentlichungen, Zahlungen und Änderungen an produktiven Systemen.

Visualisierung von Anthropics neu entdecktem Enzymsystem
Bildquelle: Anthropic

Claude entdeckt autonom ein CRISPR-ähnliches Enzymsystem

Kurz gesagt

Anthropics Life-Sciences-Team ließ Claude selbstständig nach neuen biologischen Zusammenhängen suchen. Das System identifizierte dabei eine bislang unbekannte Enzymfamilie, die mit wiederkehrenden DNA-Sequenzen verbunden ist.

Details

  • 950 Agents arbeiteten laut Anthropic 21 Stunden lang und verbrauchten zusammen rund 210 Millionen Token.
  • Der menschliche Beitrag beschränkte sich in der digitalen Phase auf den Ausgangsauftrag; sämtliche Laborarbeiten führten Wissenschaftler aus.
  • Die genaue biologische Funktion ist noch nicht geklärt. Weitere Laborexperimente sollen die Hypothese prüfen.

Warum das wichtig ist

Der wirtschaftliche Hebel liegt nicht nur im schnelleren Schreiben. Agenten können große Suchräume parallel untersuchen und Hypothesen erzeugen, die anschließend gezielt im Labor getestet werden.

Was du mitnehmen solltest

AI kann die Suche beschleunigen, ersetzt aber nicht die experimentelle Bestätigung. Das produktive Muster lautet: breit maschinell suchen, eng menschlich prüfen.

Tool-Radar

Naise AI

Setzt Marketing Agents auf konkrete Ausführung an: Kampagnen planen, Assets koordinieren und Aufgaben nicht nur vorschlagen, sondern abarbeiten.

Solid

Gibt Agents eigene Rechner, Accounts und Budgets - ein Ansatz für dauerhaft laufende digitale Mitarbeiter mit klar abgegrenzten Ressourcen.

Floot MCP

Erstellt und veröffentlicht Web- sowie Mobile-Apps direkt aus Claude oder ChatGPT, ohne den Gesprächskontext zu verlassen.

Was auffällt

Ein AI-Agent greift erstmals eine Regierungswebsite an

Nature beschreibt einen Vorfall, bei dem ein Agent selbstständig Schwachstellen einer Behörden-Website suchte. Entscheidend ist weniger, ob der Angriff erfolgreich war, sondern dass Planung und Ausführung zunehmend ohne fortlaufende menschliche Steuerung möglich werden.

Gemini verbindet mehr Apps und vergrößert damit seinen Handlungsspielraum

Google rollt Connected Apps breiter aus. Je mehr Dienste ein Agent erreicht, desto nützlicher wird er - aber auch desto wichtiger werden verständliche Berechtigungen, widerrufbarer Zugriff und ein überprüfbares Aktivitätsprotokoll.

GitHub Repo der Woche

stablyai/orca

Warum beliebt

Orca organisiert mehrere Coding Agents parallel und funktioniert auf Desktop, Mobile und einer Remote Runtime. Eigene Abonnements der jeweiligen Agenten lassen sich weiterverwenden.

Beispiel

Ein Agent bearbeitet das Frontend, ein zweiter prüft Tests und ein dritter untersucht einen Fehler - während du Fortschritt und Ergebnisse in einer Oberfläche vergleichst.

Lerneffekt

Der nächste Produktivitätsschritt ist nicht zwingend ein stärkeres Model, sondern eine bessere Orchestrierung: klare Aufgaben, getrennte Arbeitsbereiche und ein gemeinsamer Review.

KI-Notizen

KI schreibt mehr Tests. Aber testen sie das Richtige?

KI erzeugt in Sekunden Hunderte Unit-Tests. Manche bestätigen allerdings nur, was der Code ohnehin tut - inklusive seiner Fehler. Wenn Implementierung und Tests denselben Denkfehler enthalten, ist alles grün, obwohl die Anwendung nicht richtig funktioniert.

Die klassische Testpyramide orientierte sich häufig an 70 % Unit-Tests, 20 % Integrationstests und 10 % End-to-End-Tests. Das war eine Faustregel, keine verbindliche Vorgabe.

Für typische, KI-gestützt entwickelte Webanwendungen würde ich 40/40/20 als Startpunkt empfehlen:

TestebeneKlassische OrientierungMeine Empfehlung
E2E: vollständige Nutzerwege10 %20 %
Integration: Zusammenspiel der Bausteine20 %40 %
Unit: einzelne Regeln und Funktionen70 %40 %

Damit bekommt die Pyramide eine breitere Mitte und eine stärkere Spitze. Unit-Tests sichern weiterhin Berechnungen und Grenzfälle ab. Integrationstests prüfen beispielsweise API und Datenbank gemeinsam. E2E-Tests zeigen, ob eine Anmeldung vom Formular bis zum aktivierten Konto funktioniert.

40/40/20 ist meine praktische Orientierung, kein wissenschaftlich belegter neuer Standard. Die Anteile beziehen sich auf die Anzahl automatisierter Testfälle, nicht auf Laufzeit oder Aufwand. Bei komplexen Berechnungen dürfen deutlich mehr Unit-Tests sinnvoll sein.

Entscheidend bleibt: Erwartungen aus Anforderungen ableiten, überflüssige Tests aussortieren und der KI nicht erlauben, Prüfungen einfach abzuschwächen, bis alles grün ist. Jeder Test sollte einen relevanten Fehler entdecken können.

Community-Erfolg
Fatons Community-Erfolg

Faton Duraku: Drei Jahre Vollgas - und das ist erst der Anfang

Faton gibt seit drei Jahren bei uns Vollgas. Er hat einen Vollzeitjob, ist Familienvater und Ehemann und kommt nicht aus der IT. Trotzdem ist er all in: Er bleibt dran, lernt und setzt um - neben all der Verantwortung, die er im Alltag trägt.

Das Ergebnis siehst du hier. Dahinter stecken drei Jahre Einsatz, Ausdauer und der Wille, immer weiterzulernen. Genau diesen Weg möchten wir heute mit ihm feiern.

Faton, die ganze Community ist unfassbar stolz auf dich. Und dein Weg hat gerade erst angefangen!

Abschluss

Das war's für diese Ausgabe.

Wenn du eine spannende Tool-Entdeckung, eine Frage oder eine eigene Erfolgsgeschichte hast, schick sie mir gern direkt zu.

Wenn du bei einem KI-Thema Unterstützung suchst oder eine Zusammenarbeit im Kopf hast, melde dich gern. Aktuell sind kaum Kapazitäten frei; wenn es passt, komme ich auf dich zurück.