Das Weisse Haus hebt Beschränkungen für Anthropics fortschrittlichste Modelle Mythos und Fable wieder auf. Erst Wochen zuvor musste das Unternehmen den Zugang für ausländische Staatsangehörige sperren. Damit öffnet sich der internationale Zugriff auf die Spitzenmodelle erneut, was Anthropics Marktposition ausserhalb der USA stärkt.
Ein neuer Angriff versetzt LLMs in eine Traumwelt, in der Sicherheitsschranken nicht mehr greifen. Die Behauptung, dass 2 + 2 = 5 sei, reicht aus, um das Modell zu verbotenen Anweisungen zu bewegen. Das erhöht das Risiko bei autonom agierenden KI-Browsern erheblich.
Googles rund um die Uhr aktiver Agent Gemini Spark ist ab sofort auf dem Mac verfügbar und unterstützt nun mehr Apps sowie Echtzeit-Tracking. Damit erreicht der Assistent Apple-Nutzer direkt am Desktop und konkurriert dort mit lokalen Werkzeugen und Automatisierungsdiensten.
Anthropics neue App Claude Science ist eine KI-gestützte Forschungswerkbank für die Life Sciences mit über 60 Werkzeugen. Sie läuft auf macOS, Linux, lokalen Maschinen, Remote-Clustern und via SSH. Damit erhalten Forschende eine integrierte Umgebung für rechenintensive wissenschaftliche Arbeit.
TestingCatalog AI (testingcatalog.com) · Forschung
Reinforcement Learning steht im Zentrum der Ausrichtung von Sprachmodellen, von RLHF in Assistenten bis zu neuen RLVR-Methoden für Reasoning und Agenten. Die Technik wird nun praktisch für spezialisierte KI. Firmen können damit präzisere Agenten für ihre fachspezifischen Aufgaben trainieren.
NVIDIA Generative AI (developer.nvidia.com) · Agenten
Ein Leitfaden zeigt, wie sich BoltzGen auf SageMaker AI bereitstellen und für ein durchgängiges Proteindesign-Experiment nutzen lässt. Der Aufbau skaliert von schnellen Validierungsläufen bis zur Batch-Produktion. Caching auf Schrittebene senkt die Rechenkosten bei iterativen Läufen deutlich.
IBM Research veröffentlicht ScarfBench, einen Benchmark zur Bewertung von KI-Agenten bei der Migration von Enterprise-Java-Frameworks. Der Test misst, wie gut Agenten komplexe Umstellungen bewältigen. Damit erhalten Entwicklungsprojekte eine Vergleichsgrundlage für agentische Migrationsaufgaben.
Der neue Befehl shot-scraper video nimmt anhand einer storyboard.yml-Datei per Playwright ein Video eines Ablaufs in einer Web-App auf. Damit können Coding-Agenten Demos ihrer Ergebnisse erzeugen. Das erleichtert die Überprüfung von Agentenarbeit ohne manuelles Nachstellen der Schritte.