KI Software, Coding & Entwicklung
KI-Agenten übernehmen zunehmend komplexe Aufgaben - OpenAI berichtet über erhebliche Steigerung
OpenAI hat berichtet, dass ihre KI-Agenten nun 3,1 Tage an Forschungsarbeit pro Arbeitstag eines menschlichen Mitarbeiters leisten. Diese Agenten übernehmen zunehmend komplexe Aufgaben wie technische Problemlösungen und das Monitoring von Experimenten. Trotz der gesteigerten Effizienz sind die Kosten für den Einsatz dieser Technologien hoch. Ein Test von Claude Code und Codex anhand von drei realen Projekten zeigte, dass es keinen eindeutigen Sieger gibt. Die Schwester von Dolly Parton hat die Fans aufgefordert, mehr Mitgefühl zu zeigen und sich gegen die Flut an KI-generierten Inhalten und Fehlinformationen zu wehren. Die Plattform CodeRabbit hat die Leistungsfähigkeit des neuen Modells GPT-6 Astra bewertet und festgestellt, dass es etwa 33% mehr Bugs erkennen kann. Die JTAI-Aktie hat nach einem Reverse Split und einem Spin-off ein neues 52-Wochen-Tief erreicht.
Wichtigste Punkte
- OpenAI: KI-Agenten leisten 3,1 Tage an Forschungsarbeit pro Arbeitstag eines menschlichen Mitarbeiters
- Claude Code und Codex getestet anhand von drei realen Projekten
- Kein eindeutiger Sieger bei dem Test
- Stella Parton: Fans sollen mehr Mitgefühl zeigen und sich gegen KI-generierte Inhalte wehren
- CodeRabbit: GPT-6 Astra erkennen 33% mehr Bugs
- JTAI-Aktie erreicht neues 52-Wochen-Tief nach Reverse Split und Spin-off
Chronologie / Entwicklungen
- 2026-09-06 · OpenAI hat kürzlich berichtet, dass ihre KI-Agenten nun 3,1 Tage an Forschungsarbeit pro Arbeitstag eines menschlichen Mitarbeiters leisten, was eine erhebliche Steigerung im
- 2026-09-05 · CodeRabbit, eine führende Plattform für KI-gestützte Code-Reviews, hat die Leistungsfähigkeit des neuen Modells GPT-6 Astra von OpenAI bewertet, das am 3.
- 2026-09-04 · Zoho hat die aktualisierte Plattform Catalyst 3.0 vorgestellt, die erstmals KI-Agenten in den Entwicklungsprozess integriert.
- 2026-09-03 · Die DJI Osmo 360 II ist eine kompakte Actionkamera, die 360-Grad-Videos in beeindruckender 8K-Qualität mit 60 Bildern pro Sekunde aufnimmt.
- 2026-09-02 · Die gemeinnützige Organisation Protect Democracy hat eine Klage gegen vier Bundesbehörden eingereicht, um Informationen über das geheime Regelwerk der Trump-Administration zur
- 2026-09-01 · Am 25.
Originallinks
Alle Artikel, die in diese Summary eingeflossen sind. So können Leser jederzeit die Originalquelle öffnen.
OpenAI: agentes ya hacen 3,1 veces la investigación de su gente
OpenAI hat kürzlich berichtet, dass ihre KI-Agenten nun 3,1 Tage an Forschungsarbeit pro Arbeitstag eines menschlichen Mitarbeiters leisten, was eine erhebliche Steigerung im Vergleich zu 2026 darstellt. Diese Agenten übernehmen zunehmend komplexe Aufgaben wie technische Problemlösungen und das Monitoring von Experimenten, während die strategische Planung weiterhin von Menschen durchgeführt wird. Trotz der gesteigerten Effizienz sind die Kosten für den Einsatz dieser Technologien hoch, mit durchschnittlichen Ausgaben von über 600 USD pro Tag für Forscher. OpenAI hat zudem Fortschritte bei der Entwicklung eines automatisierten Forschungspraktikanten gemacht und plant, bis März 2028 einen vollständig automatisierten Forscher zu schaffen. Allerdings sind die veröffentlichten Daten intern und nicht unabhängig verifizierbar, was Bedenken hinsichtlich der Qualität der Ergebnisse aufwirft. Sicherheitsbedenken haben zu Anpassungen in der Infrastruktur geführt, die die Zuweisung von Rechenressourcen beeinflussen. Die Erfahrungen von OpenAI bieten wertvolle Erkenntnisse für andere Technologieunternehmen, insbesondere in Bezug auf die Balance zwischen Geschwindigkeit, Kosten und der Notwendigkeit einer sorgfältigen Überwachung der KI-Nutzung.
I Tested Claude Code vs Codex on Real Projects. The Winner Surprised Me
In einem zweiwöchigen Test wurden die KI-Coding-Agenten Claude Code und Codex anhand von drei realen Projekten verglichen: einer veralteten internen API, einem React-Dashboard und einem Datensammlungsskript. Der Autor, zunächst skeptisch gegenüber dem Vergleich, stellte fest, dass das erwartete Sieger-Tool nicht in allen Bereichen überlegen war. Überraschenderweise erwies sich das als unterlegen angesehene Tool als äußerst nützlich für seinen Arbeitsablauf. Die Ergebnisse zeigten, dass es keinen eindeutigen Gewinner zwischen Claude Code und Codex gibt, da beide Tools in unterschiedlichen Szenarien ihre eigenen Stärken und Schwächen aufwiesen. Diese Erkenntnisse sind für Entwickler von Bedeutung, die zwischen diesen beiden KI-Coding-Agenten wählen müssen.
Dolly Parton’s sister urges fans to have more ‘compassion’ after ‘endless AI garbage’ surfaces online
Stella Parton, die Schwester von Dolly Parton, hat die Fans in einem Instagram-Post aufgefordert, nach dem Tod der Country-Legende mehr Mitgefühl zu zeigen. Sie betonte, dass die Familie unter immensem Druck und Unsensibilität leidet, während sie ihre Trauer verarbeitet. Stella kritisierte die Flut an KI-generierten Inhalten und Fehlinformationen, die die Trauer der Familie zusätzlich belasten. Sie erinnerte die Fans an den positiven Einfluss ihrer Schwester und forderte sie auf, Toleranz und Respekt zu leben. Partons Nichte, Lainey, teilte eine berührende Hommage und bestätigte, dass Dolly in einem privaten Familienbegräbnis beigesetzt wurde. Stella enthüllte zudem, dass Dolly in ihren letzten Tagen bereit war, experimentelle Krebsmedikamente zu testen, um anderen zu helfen, was ihren selbstlosen Charakter unterstreicht.
GPT-6 Astra en code review: CodeRabbit detecta 33% más bugs
CodeRabbit, eine führende Plattform für KI-gestützte Code-Reviews, hat die Leistungsfähigkeit des neuen Modells GPT-6 Astra von OpenAI bewertet, das am 3. September vorgestellt wurde. Die Analyse zeigt, dass Astra in der Lage ist, etwa 33% mehr Bugs zu erkennen, insbesondere bei komplexen Code-Reviews, die mehrere Dateien umfassen. Dies wird auf die verbesserte Fähigkeit von Astra zurückgeführt, relevante Informationen effektiv zu verknüpfen. Die Bewertung betont, dass nicht die Kosten pro Token, sondern die Kosten pro erfolgreich abgeschlossener Aufgabe entscheidend für die Modellauswahl sind. Astra bietet zudem eine Null-Daten-Retention-Option für berechtigte Kunden, während das Modell von Anthropic eine 30-tägige Datenaufbewahrung vorschreibt. CodeRabbit empfiehlt, die eigene automatische Überprüfung zu auditieren und A/B-Tests durchzuführen, um die Effizienz der Modelle zu vergleichen. Die Einführung von Astra wirft Sicherheitsbedenken auf, da OpenAI bestätigt hat, dass das Modell hohe Cyberfähigkeiten erreicht hat, was eine sorgfältige Evaluierung für Gründer erforderlich macht.
Die JTAI-Aktie faellt nach Reverse Split auf 52-Wochen-Tief
Die JTAI-Aktie hat nach einem drastischen Reverse Split und einem Spin-off am 5. September 2026 ein neues 52-Wochen-Tief erreicht, was zu einem Kursrückgang von nahezu 50 Prozent an einem einzigen Handelstag führte. Diese Maßnahmen wurden ergriffen, um die Mindestanforderungen an den Nasdaq-Bid-Price zu erfüllen, nachdem der Kurs zuvor längere Zeit unter dieser Schwelle lag. Aktionäre erhielten für jede Aktie von Jet. AI 2,9002 Anteile des ausgegliederten Unternehmens FLYX, während der Reverse Split im Verhältnis 1 zu 200 die Anzahl der ausstehenden Aktien erheblich reduzierte. Trotz des dramatischen Kurssturzes bleibt die Gesamtbewertung des Unternehmens unverändert, was jedoch die Volatilität erhöhen kann. Die Marktreaktion wird als typische kurzfristige Verunsicherung der Anleger eingeordnet, die häufig bei solchen extremen Kapitalmaßnahmen auftritt. Die zukünftige Entwicklung der JTAI-Aktie hängt entscheidend von der operativen Erfolgsfähigkeit von Jet. AI und der Marktakzeptanz der neuen Struktur ab, um eine stabilere Kursentwicklung zu ermöglichen.
Comparing AI Evaluation Experiments: Measuring the Impact of Changes to AI Applications
In dem Artikel "Comparing AI Evaluation Experiments: Measuring the Impact of Changes to AI Applications" wird die Methodik zur Bewertung von Änderungen an KI-Anwendungen untersucht. Der Schwerpunkt liegt auf der Messung der Leistungsverbesserungen durch gezielte Evaluierungsexperimente. Hierbei wird ein spezifischer Datensatz erstellt, der sowohl Ziel- als auch Regressionstests umfasst, um sicherzustellen, dass neue Änderungen die gewünschten Verbesserungen bringen, ohne die bestehende Funktionalität zu beeinträchtigen. Die Experimente werden mehrfach durchgeführt, um konsistente Ergebnisse zu gewährleisten, da KI-Anwendungen oft variierende Antworten auf identische Eingaben liefern. Nach der Implementierung einer Änderung, die deterministische Entscheidungen in den Code integriert, erfolgt ein Vergleich der Testergebnisse mit der ursprünglichen Version. Die Analyse bestätigt, dass die vorgenommenen Änderungen die angestrebten Verbesserungen erzielt haben, während die Funktionalität der Anwendung erhalten blieb. Dies unterstreicht die Bedeutung experimenteller Vergleiche für fundierte Entscheidungen bei der Weiterentwicklung von KI-Anwendungen.
Zoho lanza Catalyst 3.0 con agentes de IA y nivel gratis
Zoho hat die aktualisierte Plattform Catalyst 3.0 vorgestellt, die erstmals KI-Agenten in den Entwicklungsprozess integriert. Diese Agenten, darunter Claude Code von Anthropic und Codex von OpenAI, unterstützen Entwickler bei der Erstellung, dem Testen und der Bereitstellung von Anwendungen, während die Plattform die Infrastruktur verwaltet. Zu den neuen Funktionen gehören ein offenes Repository für Agentenfähigkeiten, eine nicht-interaktive Befehlszeilenschnittstelle und Unterstützung für das Model Context Protocol, was die Interaktion mit externen Tools erleichtert. Catalyst 3.0 zielt darauf ab, die Komplexität der Cloud-Bereitstellung zu reduzieren und die Effizienz der Entwickler zu steigern, indem es eine nahtlose Verbindung zwischen Codegenerierung und Implementierung schafft. Zudem bietet Zoho ein kostenloses monatliches Nutzungsniveau, Kredite für neue Nutzer und einen kostenlosen Plan für Studenten, um den Zugang zur Plattform zu fördern. Diese Strategie könnte Zoho helfen, sich im Wettbewerb mit anderen Anbietern von KI-gestützten Entwicklungstools zu positionieren, während die Nachfrage nach solchen Technologien unter Entwicklern steigt.
XDOF, Scale AI de la robótica, negocia Serie B a US$1.200M
XDOF, ein 2024 gegründetes Startup, steht kurz vor einer Serie-B-Finanzierungsrunde mit einer Bewertung von etwa 1,2 Milliarden US-Dollar, nur drei Monate nach einer erfolgreichen Serie-A-Runde über 70 Millionen US-Dollar. Der rasante Anstieg der Unternehmensbewertung ist auf ein signifikantes Wachstum zurückzuführen, mit einem annualisierten Umsatz von fast 50 Millionen US-Dollar. XDOF bietet Datenpipelines und Annotationssysteme für die Robotik an, was es besonders attraktiv für Unternehmen macht, die diese Technologien nicht intern entwickeln können. Die zugrunde liegende Technologie stammt aus einem akademischen Projekt, das es ermöglicht, Roboter aus der Ferne zu steuern, um Trainingsdaten zu generieren. Das Unternehmen kombiniert verschiedene Datenerfassungsmethoden, darunter die Fernsteuerung von Robotern und tragbare Sensoren zur Erfassung von Bewegungsdaten im Alltag. Der Markt für KI-Daten wird derzeit neu bewertet, was sich in den hohen Bewertungen ähnlicher Unternehmen wie Mercor und Scale AI zeigt. Dies verdeutlicht den zunehmenden Wert physischer Daten in der KI-Industrie und die damit verbundenen Investitionsmöglichkeiten.
The sameness problem behind those unappetizing AI-generated menus
Die Einführung von KI-generierten Menüs in der Gastronomie bringt ein Problem der Homogenität mit sich. Die Bilder dieser Menüs weisen oft eine unnatürlich perfekte Ästhetik auf, die viele Betrachter irritiert. Diese Darstellungen basieren auf großen Datensätzen, die zu einer übertriebenen und künstlerischen Darstellung von Speisen führen, die wenig mit realem Essen zu tun hat. Experten erklären, dass die KI-Modelle aufgrund einer begrenzten Datenbasis zu einer Konvergenz neigen, was die Qualität der Ergebnisse beeinträchtigt. Diese Homogenisierung wird durch die Optimierung der Datensätze verstärkt, wodurch die Bilder immer ähnlicher und weniger authentisch wirken. Studien zeigen, dass Menschen eine Abneigung gegen diese KI-generierten Bilder empfinden, was zu einem Widerstand gegen deren Verwendung in Restaurants führt. Interessanterweise rufen Bilder, die fast realistisch erscheinen, oft mehr Ekel hervor als offensichtlich gefälschte Darstellungen. Angesichts dieser negativen Reaktionen könnte es für Restaurants ratsam sein, von der Nutzung solcher KI-generierten Menüs abzusehen, da die kulturelle Wahrnehmung von KI zunehmend kritisch wird.
Mini book: Next-Gen Architecture Playbook: Insights and Patterns for the AI Era
Das "Next-Gen Architecture Playbook" beleuchtet den tiefgreifenden Wandel in der Softwarearchitektur, der durch schnelle Iterationen, cloud-native Ansätze und die Integration von KI geprägt ist. Diese Entwicklungen führen zu einem Vertrauensverlust unter Ingenieuren, da fast 30 % der Fachleute KI-generiertem Code misstrauen. Dies unterstreicht die Notwendigkeit für eine verstärkte architektonische Aufsicht und Validierung. Das Playbook und die begleitende Podcast-Serie richten sich an technische Führungskräfte, deren Verantwortung über den reinen Systembau hinausgeht und auch ethische Überlegungen sowie die Unterstützung von Ingenieurteams umfasst. Die kontinuierliche Gestaltung in der Produktion erfordert, dass Klarheit, Integrität und sorgfältige Handwerkskunst gewahrt bleiben, um Systeme zu entwickeln, die sowohl den Menschen als auch dem technologischen Fortschritt dienen. Zudem werden neue Herausforderungen thematisiert, insbesondere die Interaktion zwischen deterministischer Software und nicht deterministischer KI.
Cisco targets zero engineers writing code by end-October
Cisco hat angekündigt, bis Ende Oktober keine Ingenieure mehr mit dem Schreiben von Code zu beschäftigen. Diese Entscheidung reflektiert die wachsende Bedeutung von Künstlicher Intelligenz, die Unternehmen zwingt, ihre Softwareentwicklungsprozesse neu zu überdenken. Fortschrittliche KI-Modelle erfordern eine schnellere Ablösung veralteter Systeme, da technische Schulden zunehmend auf Vorstandsebene thematisiert werden. Ciscos Warnung hebt hervor, dass Cybersecurity nicht nur eine technische Herausforderung, sondern auch eine strategische Unternehmensangelegenheit ist. Der Verzicht auf menschliche Programmierer könnte weitreichende Auswirkungen auf die Softwareentwicklung und die Sicherheitsarchitektur des Unternehmens haben, was Fragen zur Zukunft der Programmierung und der Rolle von KI in der Branche aufwirft.
Chinese carmaker to begin testing solid-state batteries next year
Chery Automobile, Chinas größter Autoexporteur, plant, im kommenden Jahr mit Tests von Festkörperbatterien zu beginnen, um die Kommerzialisierung dieser vielversprechenden Technologie voranzutreiben. Der Vorsitzende Yin Tongyue kündigte an, dass das Unternehmen in den nächsten zwei Jahren 10 Milliarden Yuan in die Entwicklung investieren und 1.200 Ingenieure für innovative Durchbrüche einsetzen wird. Die neuen Batterien sollen eine Energiedichte von 400 Wattstunden pro Kilogramm erreichen, was doppelt so viel ist wie bei aktuellen Lithium-Ionen-Batterien. Festkörperbatterien gelten als sicherer und leistungsfähiger, da sie weniger anfällig für Überhitzung oder Brände sind. Trotz dieser Vorteile sind sie bislang nicht in massenproduzierten Elektrofahrzeugen zu finden. Yin gab jedoch keinen Zeitrahmen für die Markteinführung von Chery-Fahrzeugen mit dieser Technologie an. Experten warnen, dass die Technologie noch nicht ausgereift ist und die Kosten gesenkt werden müssen, um für Verbraucher erschwinglich zu sein.
Anthropic formaliza el teorema de Fermat con Claude en 11 días
Anthropic hat in nur 11 Tagen eine vollständige Formalisierung des letzten Fermatschen Theorems mit ihrem KI-Modell Claude erreicht, was einen bedeutenden Fortschritt in der mathematischen Forschung darstellt. Diese Leistung, die auf der Plattform prove2.me erzielt wurde, umfasste über 13,4 Millionen Zeilen Code und fast 29.500 Zwischenresultate. Der Erfolg verdeutlicht die Fähigkeit von KI-Modellen, komplexe mathematische Beweise autonom zu erstellen und zu verifizieren, was die Effizienz in der mathematischen Überprüfung erheblich steigert. Kevin Buzzard, der ein ähnliches Projekt mit einem Budget von 1 Million Pfund über fünf Jahre leitete, bestätigte, dass Anthropic die technische Herausforderung in einem Bruchteil der Zeit bewältigte. Obwohl die Formalisierung keine neuen mathematischen Erkenntnisse lieferte, zeigt sie, wie KI große Informationsmengen verarbeiten und synthetisieren kann. Diese Entwicklung hat weitreichende Implikationen für die Software- und KI-Branche, insbesondere in der formalen Verifizierung kritischer Software. Buzzard betont jedoch, dass die menschliche Komponente in der Mathematik weiterhin unerlässlich bleibt, insbesondere zur Verständlichkeit komplexer Beweise. Die Ergebnisse von Anthropic könnten die zukünftige Behandlung mathematischer und technischer Dokumente revolutionieren.
heise+ | 360-Grad-Actionkamera: DJI Osmo 360 II mit 8K-Aufnahme und großem Sensor im Test
Die DJI Osmo 360 II ist eine kompakte Actionkamera, die 360-Grad-Videos in beeindruckender 8K-Qualität mit 60 Bildern pro Sekunde aufnimmt. Ein herausragendes Merkmal ist die KI-gestützte automatische Motivverfolgung sowie die Möglichkeit, die Objektivgläser auszutauschen, was besonders für 3D-Videoanwendungen in herausfordernden Umgebungen von Vorteil ist. Im Test wird die Osmo 360 II mit ihrem Vorgängermodell und dem Konkurrenzmodell Insta360 X6 verglichen, die beide 8K-Videos mit 50 fps aufnehmen. Obwohl die Osmo 360 II eine höhere Bildrate bietet, zeigt sich, dass dies in der Praxis kaum spürbare Vorteile bringt. Insgesamt wird die Kamera als vielversprechende Wahl für anspruchsvolle Videografen angesehen, die hohe Auflösung und Flexibilität schätzen.
Who Spent What: Budgets, Alerts, and Audit for Your LLM Gateway
Der Artikel "Who Spent What: Budgets, Alerts, and Audit for Your LLM Gateway" thematisiert die Notwendigkeit eines effektiven Budget- und Auditsystems für LLM-Gateways, um unerwartete Kosten zu vermeiden. Obwohl das Gateway in der Lage ist, den Datenverkehr zu bewältigen, kann es zu finanziellen Überlastungen kommen, wenn die Ausgaben nicht kontrolliert werden. Ein Beispiel verdeutlicht, dass die Betriebskosten von 3.100 auf 8.400 Dollar anstiegen, ohne dass das Team informiert wurde, da das System auf einen teureren Anbieter umschaltete, um die Leistung zu sichern. Diese kurzfristige Resilienz kann jedoch langfristig das Projekt gefährden. Um dies zu verhindern, sind Mechanismen zur Ausgabenbegrenzung und frühzeitigen Problemerkennung unerlässlich. Der Artikel betont die Bedeutung solider Governance, um Vertrauen in das System zu schaffen und die finanziellen Aspekte transparent und kontrollierbar zu halten.
Termingarantie für alle AI-Kurse für Softwaretester bis zum Ende des Jahres
Die Knowledge Department GmbH bietet bis Ende des Jahres eine Termingarantie für verschiedene AI-Kurse für Softwaretester an. Zu den nächsten festen Terminen gehören die Kurse „ISTQB Certified Tester - Testen mit Generative AI“ und „ISTQB Certified Tester – AI Testing (CT-AI) v2. 0“, die im September, Oktober und November 2026 stattfinden. Der Lehrplan für den CT-AI-Kurs vermittelt Kenntnisse über das Testen von KI-basierten Systemen, einschließlich Machine-Learning-Modellen und neuronalen Netzen. Im Gegensatz dazu fokussiert sich der Kurs zum Testen mit generativer KI auf die methodische Anwendung dieser Technologien im Testprozess, wobei Qualitätssicherung und realitätsnahe Teststrategien im Mittelpunkt stehen. Beide Kurse sind sowohl als Inhouse-Trainings vor Ort als auch als virtuelle Klassen verfügbar, was den Zugang zu diesen wichtigen Schulungen erleichtert.
I Used Claude Code Wrong for 6 Months. These 12 Commands Finally Made It Click
In dem Artikel „I Used Claude Code Wrong for 6 Months. These 12 Commands Finally Made It Click“ teilt der Autor seine Erfahrungen mit dem KI-Coding-Agenten Claude Code, den er zunächst ineffektiv nutzte, indem er ihn wie einen einfachen Chatbot behandelte. Diese falsche Herangehensweise führte zu ungenauen Ergebnissen und langsamen Sitzungen, wodurch er die Effizienz des Tools unterschätzte. Erst als er begann, gezielt die richtigen Befehle zu verwenden, verbesserte sich die Qualität seiner Arbeit erheblich. Die Anwendung spezifischer Kommandos sorgte für stabilere Sitzungen, reduzierte Fehler und sparte Zeit, die er zuvor mit nicht umkehrbaren Änderungen verloren hatte. Der Autor bedauert, dass ihm diese zwölf wichtigen Befehle nicht von Anfang an bekannt waren, da viele Nutzer die Vorteile dieser gezielten Nutzung nicht erkennen, da Claude Code auch ohne Anpassungen funktioniert.
I Asked ChatGPT to Analyze 3 Datasets. It Made the Same Mistakes Every Time
In einem Experiment wurde ein KI-Modell mit der Analyse von drei kleinen Datensätzen betraut, wobei es wiederholt zu Fehlern kam, die auf Missverständnisse in der Dateninterpretation zurückzuführen waren. Bei der Analyse von Versandverfolgungen wurde die durchschnittliche Lieferzeit fälschlicherweise als Zeitraum von Versand bis Lieferung angegeben, anstatt die Zeit von Bestellung bis Lieferung zu berücksichtigen. In einem anderen Datensatz wurden falsche Zahlen präsentiert, die nicht aus dem Code stammten, was die Ergebnisse erheblich verzerrte. Zudem führte die falsche Interpretation von Trends dazu, dass Bestellungen, die noch nicht geliefert wurden, zu irreführenden Schlussfolgerungen über schnellere Versandzeiten führten. Bei der Analyse von Athleten und Medaillen wurde zudem ignoriert, dass 226 Höhenangaben fehlten, was die Schlussfolgerung über den Einfluss der Körpergröße auf den Medaillengewinn verzerrte. Trotz eines Überprüfungsprozesses blieben einige Fehler bestehen, und die KI konnte die zugrunde liegenden Probleme nicht erkennen. Diese Ergebnisse verdeutlichen die Bedeutung einer präzisen Dateninterpretation und des Verständnisses der zugrunde liegenden Fragestellungen für korrekte Analysen.
CHPT spans wafer to system-level testing
Chunghwa Precision Test Tech stellte auf der SEMICON Taiwan 2026 innovative Testlösungen für KI-Chips und Hochleistungsrechner (HPC) vor. Zu den präsentierten Technologien gehören AI-Probekarten, Speicherprobekarten und hochpinige Probekarten, die eine umfassende Prüfung von Chips ermöglichen, die in anspruchsvollen Anwendungen eingesetzt werden. Diese Entwicklungen zielen darauf ab, die Effizienz und Zuverlässigkeit von Chips zu verbessern, was angesichts der wachsenden Anforderungen in der KI- und HPC-Branche von entscheidender Bedeutung ist. Die neuen Produkte sollen die Testprozesse optimieren und die Markteinführungszeit neuer Technologien verkürzen, um den steigenden Bedürfnissen des Marktes gerecht zu werden.
Building High-Quality and Trusted Data Products with Databricks
Der Artikel "Building High-Quality and Trusted Data Products with Databricks" thematisiert die Notwendigkeit hochwertiger und vertrauenswürdiger Datenprodukte für Organisationen, die auf KI und datengestützte Entscheidungen setzen. Es wird empfohlen, das Daten-Mesh-Paradigma zu nutzen, um die Verantwortung für Daten zu demokratisieren. Ein zentraler Bestandteil ist der Datenproduktbesitzer, der die Entwicklung und Qualität der Produkte überwacht. Die Erstellung hochwertiger Datenprodukte erfordert klare Eigentumsverhältnisse und umfassende Datenverträge, die Qualitätsmetriken und Sicherheitsparameter festlegen. Der Einsatz von Delta Live Tables und automatisierten Überwachungsmechanismen trägt zur Sicherstellung der Datenqualität bei. Governance-Teams unterstützen die Veröffentlichung und Zertifizierung der Produkte, indem sie Richtlinien für den Zugriff und die Nutzung festlegen. Zukünftige Trends deuten auf eine wachsende Bedeutung von Echtzeitdatenprodukten und KI-gestützten Lösungen hin. Durch die Anwendung dieser Prinzipien und die Nutzung der Databricks-Plattform können Unternehmen den Wert ihrer Datenprodukte maximieren und die Entscheidungsfindung optimieren.
Trump may be forced to reveal secret rules feds use for AI safety testing
Die gemeinnützige Organisation Protect Democracy hat eine Klage gegen vier Bundesbehörden eingereicht, um Informationen über das geheime Regelwerk der Trump-Administration zur Sicherheitsüberprüfung von KI-Modellen offenzulegen. Derzeit sind der Öffentlichkeit und dem Kongress kaum Details zu diesem Überprüfungsprozess bekannt, was als problematische Intransparenz angesehen wird. Unklar bleibt, welche Unternehmen an der Erstellung des Rahmens beteiligt sind und auf welcher rechtlichen Grundlage die Überprüfungen durchgeführt werden. Protect Democracy argumentiert, dass die Genehmigung und Veröffentlichung von KI-Modellen entscheidende politische Fragen aufwirft. Die Klage fordert die Offenlegung aller relevanten Informationen bis zum 30. September, einschließlich der unklassifizierten Verfahren und der Identität der Beteiligten. Zudem wird ein Verbot angestrebt, das die Behörden daran hindert, nicht klassifizierte Aufzeichnungen zurückzuhalten. Die Organisation betont, dass die Exekutive darüber entscheidet, welche Unternehmen ihre Produkte veröffentlichen dürfen, ohne dass eine angemessene Aufsicht durch den Kongress oder die Öffentlichkeit besteht.
SignalHandy Launches AI-Powered Reddit Monitoring Platform to Help Businesses Find Customers
SignalHandy hat eine innovative Plattform zur Überwachung von Reddit eingeführt, die Unternehmen dabei unterstützt, relevante Gespräche und potenzielle Kunden zu identifizieren. Die KI-gestützte Lösung automatisiert die Suche nach Marken- und Wettbewerbsnennungen sowie Kaufabsichten, indem sie kontinuierlich Beiträge und Kommentare auf benutzerdefinierte Schlüsselwörter überwacht. Bei Erkennung relevanter Konversationen werden diese in einem zentralen Dashboard angezeigt, und Benutzer erhalten Benachrichtigungen zur schnellen Reaktion. Die Plattform bewertet die Relevanz der gefundenen Inhalte und priorisiert sie entsprechend den Unternehmenszielen. Zudem bietet sie Vorschläge für Antworten, die vor dem Posten angepasst werden können. SignalHandy richtet sich vor allem an SaaS-Unternehmen, Startups und Marketingagenturen, die Reddit für Kundengewinnung und Wettbewerbsforschung nutzen möchten. Die Plattform bietet sowohl einen kostenlosen Plan als auch kostenpflichtige Optionen ab 9 Dollar pro Monat für erweiterte Funktionen.
Plan A Technologies Acquires Stealth AI Assessment Technology to Expand Technical M&A Due Diligence Capabilities
Plan A Technologies hat eine geheime KI-Bewertungstechnologie erworben, um seine technischen Due-Diligence-Fähigkeiten im Bereich M&A zu verbessern. Diese proprietäre Technologie ermöglicht eine schnellere Bewertung komplexer Technologieumgebungen und hilft, technische Risiken sowie Chancen zu identifizieren, die traditionelle Bewertungswerkzeuge möglicherweise übersehen. Durch die Kombination dieser neuen Technologie mit Methoden wie Experteninterviews und Code-Analysen kann Plan A tiefere Einblicke gewinnen, was besonders relevant ist, da zunehmend KI-generierter Code verwendet wird. Co-Gründer Slav Kulik hebt hervor, dass die Synergie von KI und erfahrenen Technikern zu besseren Fragen und einem umfassenderen Verständnis der zu erwerbenden Technologien führt. Serhii Melnychuk, der Entwickler der Technologie, wird Teil des Plan A-Teams, um die Integration und Weiterentwicklung voranzutreiben. Diese Akquisition ist Teil einer umfassenderen Strategie von Plan A, die darauf abzielt, die Effizienz ihrer Ingenieure und Berater durch proprietäre Technologien zu steigern. Neben technischer Due Diligence bietet Plan A auch Unterstützung bei der Entwicklung neuer Softwareprodukte, der Modernisierung von Anwendungen und der Cloud-Migration an, um Kunden nicht nur bei der Problemerkennung, sondern auch bei der Lösungsfindung zu helfen.
Oracle To Face Earnings Test After Wild Year Riding AI Wave
Oracle steht kurz vor der Veröffentlichung seiner Ergebnisse für das erste Quartal des Geschäftsjahres, was nach einem turbulenten Jahr in der 49-jährigen Unternehmensgeschichte geschieht. Im Vorjahr führte der Quartalsbericht zu einem Rekordanstieg des Aktienkurses um 36 % an einem einzigen Tag. Die in Austin, Texas, ansässige Technologiefirma hat die Investoren darüber informiert, dass ihre verbleibenden Leistungszusagen stark angestiegen sind, was die positive Entwicklung im Bereich Künstliche Intelligenz widerspiegelt. Die bevorstehenden Ergebnisse werden als entscheidender Test für die Stabilität und das Wachstum des Unternehmens angesehen, insbesondere nach einem Jahr voller Veränderungen. Analysten und Investoren sind gespannt darauf, welche Auswirkungen die finanziellen Kennzahlen auf die zukünftige Entwicklung von Oracle haben werden.
NIST Red-Teaming Competition Highlights Rising Need for AI Agent Evaluation as Market Heads Toward $11 Billion by 2036
Die NIST Red-Teaming Competition im März 2026 hat die Dringlichkeit der Evaluierung von KI-Agenten hervorgehoben, da über 250.000 Angriffsversuche von mehr als 400 Teilnehmern durchgeführt wurden. Diese Veranstaltung verdeutlicht den wachsenden Bedarf an Evaluierungs- und Simulationsplattformen, um die Zuverlässigkeit und Sicherheit von KI-Agenten vor deren Integration in Geschäftsabläufe zu testen. Der Markt für solche Plattformen wird von 980 Millionen USD im Jahr 2026 auf über 11 Milliarden USD bis 2036 anwachsen, was einer jährlichen Wachstumsrate von 27,4 % entspricht. Unternehmen benötigen strukturierte Bewertungsverfahren, um die Leistung der Agenten bei komplexen Aufgaben nachzuweisen. Cloud-basierte Lösungen werden voraussichtlich 72 % des Marktes im Jahr 2026 ausmachen, da sie flexible Evaluierungen ermöglichen. Die Nachfrage wird durch die Notwendigkeit, Sicherheitsrisiken frühzeitig zu identifizieren, und die Fähigkeit der Agenten zur sicheren Werkzeugnutzung angetrieben. Singapore wird als Vorreiter in diesem Bereich angesehen, unterstützt durch nationale KI-Programme und eine steigende Nachfrage nach sicheren Implementierungen.
Mastering the Economics of AI Agents: 4 Cost Optimization Strategies
Der Artikel "Mastering the Economics of AI Agents: 4 Cost Optimization Strategies" beleuchtet vier wesentliche Strategien zur Kostenoptimierung von KI-Agenten in einem dynamischen wirtschaftlichen Umfeld. Er betont, dass die Gesamtkosten eines erfolgreichen Ergebnisses wichtiger sind als die Kosten einzelner Modellanfragen, da jeder Prozessschritt zusätzliche Ausgaben verursacht. Ein häufiges Problem ist die Verwendung teurer Prototypen in der Produktion, was zu unnötigen Kosten führt. Microsoft Foundry schlägt vier Hebel vor: die Auswahl des passenden Modells für jede Anfrage, die Vermeidung doppelter Token-Zahlungen durch effektives Caching, die Optimierung der Eingabeaufforderungen und die Implementierung von Sichtbarkeit durch Evaluierung. Diese Strategien ermöglichen es Unternehmen, die Kosten pro Anfrage und pro erfolgreich abgeschlossenem Ergebnis zu messen und zu steuern. Durch kontinuierliche Anpassungen in diesen Bereichen können Unternehmen die Effizienz ihrer KI-Anwendungen steigern und gleichzeitig Qualität und Sicherheit gewährleisten. Der Artikel beschreibt zudem ein Kreislaufsystem, das durch wiederholte Optimierungen eine fortlaufende Verbesserung von Kosten und Leistung ermöglicht.
DeepSeek V4 Flash: Mac M5 Max führt KI lokal mit 790 Token/Sekunde
Die Demonstration des DeepSeek V4 Flash Modells auf einem Apple Mac M5 Max zeigt, dass leistungsstarke Künstliche Intelligenz nun lokal betrieben werden kann, mit Geschwindigkeiten von bis zu 790 Token pro Sekunde. Salvatore Sanfilippo, auch bekannt als antirez, betont, dass moderne Desktop-Hardware in Verbindung mit optimierter Software zunehmend komplexe Aufgaben übernehmen kann, die früher Cloud-Dienste benötigten. Die Verarbeitungsgeschwindigkeit variiert je nach Kontextlänge, wobei die beste Leistung bei einem kurzen Kontext von 2.048 Token erzielt wird. Die unter der MIT-Lizenz veröffentlichte Software DwarfStar4 unterstützt verschiedene Hardware-Backends und hat in der Entwicklergemeinschaft an Bedeutung gewonnen. Für den lokalen Betrieb des Modells wird jedoch eine leistungsstarke Hardwarekonfiguration mit mindestens 96 bis 128 GB RAM empfohlen. Zudem ermöglicht die Integration von Vision-Funktionen eine effiziente Verarbeitung von Bilddaten. Diese Entwicklungen senken die Barrieren für den professionellen Einsatz lokaler KI-Modelle und bieten insbesondere für datenschutzbewusste Anwendungen vielversprechende Möglichkeiten.
CrewAI X: The Four CrewAI Commands That Turn a Demo Into Something You Can Trust
Der Artikel "CrewAI X: The Four CrewAI Commands That Turn a Demo Into Something You Can Trust" beleuchtet vier wesentliche Befehle, die erforderlich sind, um eine Demo in ein zuverlässiges CrewAI-System zu transformieren: Training, Testing, Persistence und Replay. Diese Befehle werden oft in Tutorials übersehen, sind jedoch entscheidend für die langfristige Funktionsfähigkeit des Systems. Der Autor erläutert, dass "crewai train" durch menschliches Feedback zur Verbesserung des Systems beiträgt, während "crewai test" die Qualität messbar sichert. Der Befehl "@persist" ermöglicht die Wiederherstellung von Abläufen nach einem Systemabsturz, und "crewai replay" unterstützt das Debugging ohne zusätzliche Kosten. Insgesamt wird betont, dass das Verständnis und die Anwendung dieser Befehle unerlässlich sind, um die Vertrauenswürdigkeit und Zuverlässigkeit eines CrewAI-Systems zu gewährleisten.
AUCOTEC makes legacy diagrams usable for data-oriented engineering with AI Diagram Import
AUCOTEC hat mit AIDI eine innovative Lösung entwickelt, die es ermöglicht, bestehende technische Dokumentationen durch den Einsatz von Künstlicher Intelligenz (KI) für datengestützte Ingenieurprozesse nutzbar zu machen. Diese Technologie erkennt und interpretiert Informationen aus alten Dokumenten und überträgt sie in eine strukturierte Datenbasis für Engineering Base. Dadurch wird der manuelle Aufwand bei der Migration und Neuzeichnung in Modernisierungsprojekten erheblich reduziert. AIDI identifiziert relevante Objekte in technischen Diagrammen und verknüpft sie mit einem alphanumerischen Ingenieurdatenmodell, während die ursprüngliche grafische Darstellung erhalten bleibt. Dies ermöglicht einen schnelleren Zugriff auf Ingenieurdaten und erlaubt es Fachleuten, sich auf Validierung und technische Bewertungen zu konzentrieren. Besonders vorteilhaft ist die Lösung für Unternehmen mit umfangreichen Dokumentenbeständen, da sie eine Brücke zwischen traditioneller Dokumentation und modernen, datengestützten Ingenieurprozessen schlägt. AIDI kombiniert KI-Methoden mit technischem Fachwissen, wobei die menschliche Expertise eine zentrale Rolle spielt.
AI Evaluation Tools Market to Reach US$8.7 Billion by 2033, Growing at 27.4% CAGR
Der Markt für KI-Bewertungstools wird bis 2033 voraussichtlich auf 8,7 Milliarden US-Dollar anwachsen, mit einer jährlichen Wachstumsrate von 27,4 %. Dieses Wachstum wird durch den Übergang von experimentellen zu produktionsreifen KI-Anwendungen, insbesondere in Bereichen wie Kundenservice, Gesundheitswesen und Finanzdienstleistungen, gefördert. Unternehmen erkennen die Notwendigkeit, die Zuverlässigkeit und Sicherheit ihrer KI-Systeme zu gewährleisten, was die Nachfrage nach Bewertungstools erhöht, die Genauigkeit, Fairness und Sicherheit messen. Die Bedeutung verantwortungsvoller KI und die Einführung von Rahmenwerken wie dem AI Risk Management Framework tragen ebenfalls zur Marktentwicklung bei. Während Nordamerika und Europa die Hauptmärkte bleiben, zeigt die Region Asien-Pazifik ein starkes Wachstumspotenzial. Herausforderungen wie fehlende standardisierte Bewertungsmethoden und Datenschutzbedenken könnten jedoch die Einführung hemmen. Zudem wird eine steigende Nachfrage nach kontinuierlicher Überwachung und automatisierten Evaluierungslösungen erwartet, um die Leistung der KI-Modelle langfristig zu sichern.
AI Doesn't Have a Code Problem - It Has a Business Problem
Der Artikel "AI Doesn't Have a Code Problem - It Has a Business Problem" beleuchtet die Herausforderungen, die durch die schnelle Entwicklung von KI-gestützter Software entstehen. Es wird aufgezeigt, dass oft eine Kluft zwischen den geschäftlichen Zielen und der technischen Umsetzung besteht, da KI zwar effizient Code und APIs generiert, jedoch das Verständnis für die zugrunde liegenden Geschäftsabsichten fehlt. Dies führt zu Missverständnissen und fehlerhaften Implementierungen. Um diese Diskrepanz zu überwinden, wird die Einführung einer "Business Intent Layer" vorgeschlagen, die als Bindeglied zwischen den geschäftlichen Anforderungen und der technischen Umsetzung fungiert. Diese Schicht soll sicherstellen, dass die ursprünglichen Absichten während des gesamten Entwicklungsprozesses gewahrt bleiben. Der Artikel argumentiert, dass die Softwareentwicklung nicht nur aus einer technischen Perspektive betrachtet werden sollte, sondern auch die Bedeutung und den Kontext der geschäftlichen Absichten berücksichtigen muss. Zukünftige Tools sollten demnach nicht nur Code generieren, sondern auch die damit verbundenen geschäftlichen Konzepte und Regeln verstehen und verwalten.
# AI Is Making Code Cheaper - But Making Software Thinking More Valuable, Says ITFriends.AI
ITFriends.AI, ein lettisches Unternehmen für KI und Softwareentwicklung, hat eine Analyse veröffentlicht, die die Auswirkungen von künstlicher Intelligenz auf die Rolle von Softwareentwicklern beleuchtet. Der Fokus hat sich von der reinen Implementierung hin zu einem tieferen Verständnis von Architektur, Entscheidungsfindung und Validierung verschoben. KI-Systeme sind mittlerweile in der Lage, Anforderungen in technische Vorschläge umzuwandeln, Code zu generieren und Tests durchzuführen, was die Effizienz in der Softwareentwicklung erhöht. Entwickler müssen zunehmend in der Lage sein, Geschäftsprobleme zu verstehen und fundierte technische Entscheidungen zu treffen, anstatt nur Code zu schreiben. Trotz der Unterstützung durch KI bleibt die Verantwortung für Entscheidungen und die Validierung der Ergebnisse beim Menschen. ITFriends.AI hebt hervor, dass die Kombination aus technischem Wissen und KI-Tools Entwicklern einen Wettbewerbsvorteil verschaffen kann, indem sie komplexe Probleme effektiver lösen und KI als Partner nutzen. Die Definition eines produktiven Entwicklers wandelt sich somit von der Codierung hin zu einem umfassenderen Verständnis von Herausforderungen und der Integration von KI in den Entwicklungsprozess.
Shopify amenaza con vetar a Claude Code por no leer un estándar
Am 25. August 2026 kündigte Tobi Lütke, CEO von Shopify, in einem Tweet an, Claude Code möglicherweise von der Plattform zu verbannen. Der Grund dafür ist, dass Anthropic sich weigert, den Standard AGENTS.md zu lesen und stattdessen nur ihr eigenes Format CLAUDE.md akzeptiert. Dies hat eine intensive technische Debatte über die Herausforderungen bei der Integration verschiedener KI-Entwicklungswerkzeuge in einem großen Monorepo ausgelöst. Das Hauptproblem liegt nicht in der Funktionalität von Claude Code, sondern in der Komplexität, die entsteht, wenn nicht alle Agenten die gleichen Standards einhalten, was ineffiziente Arbeitsabläufe zur Folge hat. Entwickler fordern seit Monaten die native Unterstützung von AGENTS.md durch Claude Code, doch Anthropic hat bisher keine Pläne dafür angekündigt. Nach Lütkes Tweet versprach ein Mitglied des Claude Code-Teams, dass die Unterstützung für AGENTS.md kommen werde, was jedoch nicht alle Entwickler beruhigte, da viele die Haltung von Anthropic als problematisch ansehen.
Sara AI Pentesting soll Iberia Cards Kunden und Bankinformationen schützen
Iberia Cards hat das Programm Sara AI Pentesting eingeführt, um die Sicherheit von Kunden- und Bankinformationen zu verbessern. Angesichts der dynamischen Bedrohungslandschaft sind herkömmliche Penetrationstests nicht mehr ausreichend, weshalb ein kontinuierlicher Ansatz zur Risikobewertung erforderlich ist. Das Programm verwendet einen Grey-Box-Ansatz, der über oberflächliche Scans hinausgeht und gezielt die Geschäftslogik in Zahlungsdiensten sowie die zugehörigen Webanwendungen und APIs analysiert. Sara AI Pentesting wurde an denselben Assets getestet, die zuvor von menschlichen Forschern untersucht wurden, um die Ergebnisse zu vergleichen. Selbst ohne Authentifizierung lieferte das Tool wertvolle Erkenntnisse, und zukünftige Tests mit Anmeldedaten sollen ein umfassenderes Sicherheitsbild ermöglichen. Durch die Einführung von Sara AI Pentesting wird eine Lücke im Jahrestestprogramm geschlossen, was einen regelmäßigen Testrhythmus ermöglicht, ohne signifikante Kosten oder operativen Aufwand zu verursachen.
Penguin Ai Launches Intelligent Medical Coding and Intelligent Revenue Cycle Management Solutions in AWS Marketplace
Penguin Ai hat intelligente Lösungen für medizinische Kodierung und das Management des Einnahmenzyklus im AWS Marketplace eingeführt. Diese autonomen KI-Technologien helfen Gesundheitsdienstleistern, Probleme wie Unterkodierung und Verzögerungen bei Rückerstattungen zu lösen, indem sie über 72.000 ICD-10-Codes identifizieren und validieren. Die Automatisierung des gesamten Einnahmenzyklus, einschließlich der Überprüfung von Ansprüchen und der Bearbeitung von Ablehnungen, steigert die Effizienz der Anbieter erheblich. Die Lösungen bieten transparente Entscheidungsfindung durch Glassbox-Rationalisierung und ermöglichen eine konfigurierbare menschliche Überprüfung. Anbieter können die Technologien schnell über den AWS Marketplace beziehen und profitieren von einer 90-tägigen ROI-Garantie sowie einer hohen Erfolgsquote bei der Anfechtung von Ablehnungen. CEO Fawad Butt hebt hervor, dass die Automatisierung administrativer Aufgaben es den Anbietern ermöglicht, sich stärker auf die Patientenversorgung zu konzentrieren und finanzielle Verluste zu vermeiden.
Palestine weekly: Israel’s rightwing campaigns on anti-Palestinian abuses
Im Vorfeld der Wahlen im Oktober hat die israelische Regierung, insbesondere rechtsextreme Minister, ihre anti-palästinensische Rhetorik verstärkt und nutzt dabei KI-generierte Werbung. Finanzminister Bezalel Smotrich droht in einem Werbespot mit Maßnahmen in palästinensisch geprägten Gebieten, ähnlich denen im Westjordanland. Nationaler Sicherheitsminister Itamar Ben-Gvir veröffentlicht Videos zur Behandlung palästinensischer Gefangener. Diese Kampagne spiegelt sich in aktuellen politischen Maßnahmen wider, wie der Besetzung von UN-Einrichtungen und einer Zunahme von Gewalt gegen Palästinenser. In Gaza verschärfen israelische Luftangriffe die humanitäre Krise, da zunehmend Zivilisten betroffen sind. Im Westjordanland setzen Siedler ihre Gewalt gegen Palästinenser fort, während israelische Streitkräfte oft nicht eingreifen. Zudem beschleunigt Israel Landenteignungen und den Bau illegaler Siedlungen, was die Spannungen weiter anheizt und zur Eskalation des Konflikts beiträgt. Zwangsräumungen und Hauszerstörungen verstärken die Gewalt und vertiefen die Krise.
Operationalizing Genie Ontology in Your Data Stack
Der Artikel "Operationalizing Genie Ontology in Your Data Stack" erläutert, wie Unternehmen die Genie Ontology nutzen können, um ihre Datenmodelle und den Kontext für KI-Agenten effektiv zu operationalisieren. Um KI-Agenten mit dem erforderlichen Geschäftswissen auszustatten, ist es wichtig, dass sie nicht nur auf Daten zugreifen, sondern auch die spezifischen Definitionen, Beziehungen und Regeln des Unternehmens verstehen. Die Genie Ontology integriert modellierte Geschäftsemantik mit Kontext aus bestehenden Datenressourcen, was den Agenten ermöglicht, relevante Informationen zu priorisieren. Der Prozess umfasst mehrere Schritte: Zunächst wird eine solide Datenbasis geschaffen, gefolgt von der Anreicherung von Metadaten und dem Aufbau einer semantischen Schicht, die logische Beziehungen und Geschäftslogik definiert. Eine effektive Governance ist entscheidend, um die Sicherheit und Vertrauenswürdigkeit der Antworten der KI-Agenten zu gewährleisten. Der Artikel empfiehlt, die Implementierung schrittweise zu gestalten, beginnend mit einem hochpriorisierten Geschäftsbereich, um Vertrauen in die Antworten zu schaffen und die Datenqualität kontinuierlich zu verbessern.
LLM-as-a-Judge: How to Build Reliable AI Evaluation Systems
Der Artikel "LLM-as-a-Judge: How to Build Reliable AI Evaluation Systems" beleuchtet die Herausforderungen und Risiken bei der Verwendung von KI-Modellen, insbesondere von Large Language Models (LLMs), als Bewertungsinstrumente. Viele Nutzer vertrauen den Bewertungen dieser Modelle blind, ohne sie auf Bias oder Genauigkeit zu überprüfen. Ein Beispiel zeigt, dass ein Team eine hohe Durchschnittsbewertung von 4,4/5 erhielt, obwohl die Bewertung aufgrund fehlender Anker im System nicht aussagekräftig war. Der Autor hebt hervor, dass es unerlässlich ist, das Bewertungsmodell vor der Nutzung zu validieren. Um ein zuverlässiges LLM als Richter zu entwickeln, müssen klare Bewertungsstandards festgelegt, das Modell kalibriert und kontinuierlich überwacht werden. Dies stellt sicher, dass die Bewertungen tatsächlich aussagekräftig sind und nicht nur Durchschnittswerte widerspiegeln.
How to Use unsloth/Qwen3.8–27B-GGUF in Claude Code via Ollama Without Dying in the Process? (2/2)
Im zweiten Teil des Artikels wird erläutert, wie das Modell unsloth/Qwen3.8–27B-GGUF in Claude Code über Ollama effizient eingesetzt werden kann, ohne auf technische Schwierigkeiten zu stoßen. Der Autor betont, dass es keine universelle Konfiguration gibt und Nutzer ihre Hardware anpassen müssen, um die 27 Milliarden Parameter und den erforderlichen Kontext in 24 GB VRAM unterzubringen. Ein zentraler Schritt ist die Erstellung einer Modelfile, die spezifische Parameter wie Kontextlänge und Sampling-Parameter definiert, wobei die Standardkontextlänge von Ollama überschrieben werden muss. Zudem wird die Notwendigkeit eines Projektors für die Bildverarbeitung hervorgehoben, da dessen Fehlen zu sofortigen Fehlern bei Bildanfragen führt. Der Artikel hebt die Bedeutung einer optimalen Serverkonfiguration hervor, um Speicherprobleme zu vermeiden und die Leistung zu maximieren, wobei die Wahl des KV-Cache-Typs entscheidend ist. Schließlich wird darauf hingewiesen, dass die Kontextlänge und die Vermeidung von Überlastungen für die Effizienz des Modells entscheidend sind und Nutzer ihre spezifischen Grenzen experimentell ermitteln sollten, um die besten Ergebnisse zu erzielen.
GeoJSON Map Viewer
Am 1. September 2026 entwickelten der Autor und Natalie ein Tool zur Anzeige von GeoJSON-Dateien, um die politischen Grenzen des Granada Community Services District und des Midcoast Community Council darzustellen. Der Entwicklungsprozess begann mit einer Anfrage an GPT-5. 6-Sol, das ein entsprechendes Werkzeug entwarf. Durch mehrere Iterationen mit Claude Code und Fable 5. 1 wurde das finale Tool realisiert, das GeoJSON-Daten visualisieren und als PNG exportieren kann. Die benötigten GeoJSON-Dateien wurden durch Anfragen an ChatGPT Work generiert, das Daten aus verschiedenen Regierungsquellen extrahiert und kombiniert. So erhielt der Autor spezifische Polygondaten für die Grenzen der beiden Gemeinschaften. Das neu entwickelte Tool ermöglicht die gleichzeitige Anzeige beider Grenzen und verbessert somit die Visualisierung und den Zugang zu wichtigen geografischen Informationen.
Chain-of-Thought Monitoring Is Now Costing 20% of AI Compute: Someone's Going to Bill You For It
OpenAI hat angekündigt, dass die neue Chain-of-Thought-Überwachung etwa 20 Prozent der Rechenkosten für KI-Modelle ausmacht, was die Betriebskosten erheblich erhöht. Diese Überwachung ermöglicht Echtzeit-Analysen der Denkprozesse der Modelle, um verdächtige Aktivitäten zu identifizieren und gegebenenfalls menschliche Sicherheitsteams zu alarmieren. Obwohl OpenAI die Kosten vorerst selbst trägt, wird erwartet, dass sie bald an die Kunden weitergegeben werden, insbesondere angesichts steigender regulatorischer Anforderungen. Unternehmen, die diese zusätzlichen Kosten nicht einplanen, könnten mit unerwarteten finanziellen Belastungen konfrontiert werden. Um sich auf diese Veränderungen vorzubereiten, sollten Teams ihre Architekturen anpassen, eigene Überwachungsmechanismen implementieren und die Kosten für KI-Überwachung in ihre Finanzmodelle integrieren. Zudem wird empfohlen, die Überwachungskosten transparent zu machen und Arbeitslasten nach Überwachungsintensität zu segmentieren, um unnötige Ausgaben zu vermeiden. Die kommenden Monate bieten Unternehmen die Möglichkeit, sich proaktiv auf diese Herausforderungen einzustellen.
Blow for consumers as UK shop prices rise at fastest rate for two years
Die britischen Verbraucher sehen sich im August mit den schnellsten Preiserhöhungen seit zwei Jahren konfrontiert, da die Inflation im Einzelhandel auf 1,5 Prozent gestiegen ist, verglichen mit 0,9 Prozent im Juli. Diese Entwicklung wird durch steigende Lebensmittelpreise und Engpässe bei Chips und Speicher, die mit dem Boom der Künstlichen Intelligenz zusammenhängen, verstärkt. Die Inflation für frische Lebensmittel liegt bei 3,0 Prozent, während die allgemeinen Verbraucherpreise bei 2,9 Prozent liegen und voraussichtlich weiter steigen werden. Experten führen die Preiserhöhungen auf höhere Energiekosten und das Ende von Sommeraktionen zurück, was die Budgets der Verbraucher zusätzlich belastet. Helen Dickinson, Geschäftsführerin des British Retail Consortium, hebt hervor, dass die höheren Kosten für Energie und Rohstoffe die Preise, insbesondere bei importierten Lebensmitteln, stark beeinflussen. Mike Watkins von NIQ betont, dass Einzelhändler trotz der Preiserhöhungen versuchen, die Preise niedrig zu halten, um den Verbrauchern in Zeiten steigender Lebenshaltungskosten zu helfen. Dennoch wird ein zunehmender Preisdruck in den Lieferketten erwartet, was zu intensiverem Preiswettbewerb im Herbst führen könnte.
Anthropic's Claude Fable 5.1 promises better coding and research at up to 45 percent less
Anthropic hat die neuen KI-Modelle Claude Fable 5.1 und Mythos 5.1 vorgestellt, die eine verbesserte Codierungsleistung und höhere Textqualität bieten. Dank optimierter Cache-Lesevorgänge können die Kosten um bis zu 45 Prozent gesenkt werden, insbesondere bei komplexen Aufgaben. Allerdings gibt es widersprüchliche Berichte über die tatsächlichen Einsparungen, da Fable 5.1 bei maximaler Nutzung teurer ist als sein Vorgänger. In Benchmark-Tests zeigen die neuen Modelle signifikante Fortschritte, wobei Fable 5.1 in verschiedenen Kategorien besser abschneidet als frühere Versionen und Wettbewerber. Zudem wurden die Sicherheitsfilter für Cybersecurity- und biomedizinische Anfragen verbessert, was zu weniger Fehlalarmen führt. Insgesamt verspricht Fable 5.1 eine leistungsstarke Lösung für Entwickler und Forscher.
AI Adoption reaches 37% in Supplier Risk and Sustainability, but widespread Integration remains Limited: Achilles Survey
Laut einer aktuellen Umfrage von Achilles, die 2.805 Organisationen weltweit befragte, liegt die AI-Adoption im Bereich Lieferantenrisiko und Nachhaltigkeit bei 37%. Trotz der Nutzung von AI zur Verbesserung von Beschaffung und Risikomanagement berichten nur 2% der Befragten von einer umfassenden Implementierung. Die Umfrage zeigt, dass Unternehmen AI zunehmend als Werkzeug zur Effizienzsteigerung und Entscheidungsfindung betrachten, jedoch mit Herausforderungen wie Datenqualität und internen Fähigkeiten kämpfen. Die häufigsten Anwendungsfälle sind Prozessautomatisierung und Risikominderung, wobei die Vorteile vor allem in der Effizienzsteigerung liegen. Obwohl 45% der Organisationen eine positive Einstellung zu AI haben, bleibt die vollständige Integration eine Herausforderung, da viele AI nicht als strategische Priorität behandeln. Adam Whitfield von Achilles betont die Bedeutung vertrauenswürdiger Daten für die Effektivität von AI. Zudem haben nur 6% der Organisationen vollständige Sichtbarkeit über ihre Tier-1-Lieferanten hinaus, was die Notwendigkeit unterstreicht, Risiken in der gesamten Lieferkette besser zu verstehen. Um AI erfolgreich zu skalieren, ist die Zuverlässigkeit der Lieferantendaten entscheidend.
14 Claude Code Commands That Actually Save Time (Fact Checked)
Der Artikel "14 Claude Code Commands That Actually Save Time" beschreibt, wie der Autor seine Effizienz mit Claude Code durch die Entdeckung spezifischer Befehle erheblich gesteigert hat. Zuvor nutzte er die Software hauptsächlich als Chatbox, was zu ineffizienten Arbeitsabläufen führte, insbesondere bei der Projektbeschreibung. Ein Gespräch mit einem Kollegen, der ihn auf die existierenden Befehle hinwies, motivierte ihn, sich intensiver mit den Funktionen von Claude Code auseinanderzusetzen. Der Autor identifizierte 14 Befehle, die er nach Anwendungsbereichen sortierte, um die Übersichtlichkeit zu verbessern. Zudem überprüfte er die Befehle gegen die aktuelle Dokumentation von Anthropic, um sicherzustellen, dass er aktuelle Informationen verwendete. Diese neuen Erkenntnisse ermöglichten es ihm, Projekte schneller zu starten und die Zeit für grundlegende Erklärungen signifikant zu reduzieren.
SAP’s New Industry AI Portfolio Tackles the hardest challenges faced by Enterprises
SAP hat ein neues Industry AI Portfolio ins Leben gerufen, das darauf abzielt, die komplexesten Herausforderungen von Unternehmen zu bewältigen. Dieses Portfolio kombiniert 50 Jahre Branchenerfahrung mit fortschrittlicher KI-Technologie, um maßgeschneiderte Lösungen zu entwickeln, die direkt auf die spezifischen Probleme der Kunden eingehen. Ein zentrales Element ist die Vor-Ort-Engineering-Methode, bei der KI-Experten eng mit den Kunden zusammenarbeiten, um Lösungen zu schaffen, die echten geschäftlichen Mehrwert bieten. Diese enge Zusammenarbeit ermöglicht eine schnelle Reaktion auf Kundenbedürfnisse und die Entwicklung von Lösungen, die auf realen Erfahrungen basieren. Das Industry AI Portfolio hebt sich durch die Bereitstellung skalierbarer und wiederholbarer Lösungen ab, die auf die spezifischen Anforderungen der jeweiligen Branche zugeschnitten sind. Letztlich unterstützt SAP Unternehmen auf ihrem Weg zur autonomen Unternehmensführung, indem intelligente Prozesse in bestehende Abläufe integriert werden, was die Effizienz und Qualität verbessert.
Lunar Cyber Launches Token Exposure Monitoring as Infostealers Target Developer and AI Credentials
Lunar Cyber hat ein neues Tool zur Überwachung von Token-Exposition eingeführt, um der steigenden Bedrohung durch den Diebstahl von Entwickler- und KI-Zugangsdaten entgegenzuwirken. Angesichts der wachsenden Nutzung von KI-Entwicklungstools und Cloud-Plattformen sind Sicherheitsforscher besorgt über den Anstieg von Angriffen, bei denen API- und OAuth-Token gestohlen werden. Diese Anmeldeinformationen ermöglichen es Angreifern, auf wertvolle Dienste zuzugreifen und kostspielige KI-Workloads über die Konten der Opfer auszuführen. Das Token Exposure Monitoring hilft Sicherheitsanalysten, gestohlene Anmeldeinformationen zu identifizieren und zu verwalten, indem es Informationen über betroffene Mitarbeiter und Dienste bereitstellt. Eine besondere Herausforderung besteht darin, dass maschinenbasierte Anmeldeinformationen oft anonym sind, was die Reaktion auf Sicherheitsvorfälle erschwert. Das neue Tool ermöglicht die Echtzeitüberwachung und Validierung dieser Anmeldeinformationen, um sicherzustellen, dass sie rechtzeitig zurückgezogen oder rotiert werden. Damit wird sichergestellt, dass Entwickler-Token die gleiche Sicherheitsaufmerksamkeit erhalten wie traditionelle Passwörter.
Google unveils Gemini 3.7 Flash with enhanced coding power
Google hat das neue Modell Gemini 3.7 Flash vorgestellt, das eine verbesserte Leistung in den Bereichen Codierung und KI-Agenten bietet. Diese Version folgt auf die Einführung von Gemini 3.6 Flash und basiert auf dem Feedback von Entwicklern. Besonders hervorzuheben sind die Fortschritte bei Codierungsaufgaben wie Debugging und der Genauigkeit von Code, wobei weniger Anweisungen benötigt werden. Im WebDev Arena Benchmark erzielte Gemini 3.7 Flash eine Elo-Bewertung von 1.588, was eine Steigerung im Vergleich zur Vorgängerversion darstellt. Für Anwendungen mit großen Datensätzen, insbesondere in den Bereichen Finanzen, Recht und Lebenswissenschaften, bietet das Modell verbesserte Analyse- und Argumentationsfähigkeiten sowie genauere Informationen. Zur Förderung der Einführung bietet Google eine zeitlich begrenzte Preisaktion an, bei der die Kosten für Eingabetokens bei 0,75 USD pro 1 Million Tokens liegen und Ausgabetokens 3,75 USD kosten.
FSB chair Andrew Bailey warns G20 on AI cyber risk
Andrew Bailey, der Vorsitzende des Financial Stability Board (FSB), hat die G20-Finanzminister und Zentralbankgouverneure vor den Risiken gewarnt, die fortschrittliche KI-Systeme für die globale Finanzstabilität darstellen. In einem Brief vor dem G20-Treffen in Asheville, North Carolina, betonte er die zunehmende Autonomie dieser KI-Modelle und ihre erweiterten Bedrohungskapazitäten. Bailey kritisierte die unzureichenden Protokolle vieler Länder zur Verwaltung dieser Technologien, die ein erhöhtes Risiko für den Finanzsektor darstellen. Er forderte die Behörden auf, die sichere und verantwortungsvolle Einführung von KI zu priorisieren und die Finanzinstitute zu ermutigen, ihre Abwehrmechanismen zu stärken. Zudem warnte er vor potenziellen Marktinstabilitäten, die durch hohe Hebelwirkungen und überbewertete Aktienmärkte, insbesondere im Zusammenhang mit KI-Investitionen, entstehen könnten. Der FSB untersucht derzeit geeignete Maßnahmen zur Minderung dieser Risiken.
Claude Code Skills vs Slash Commands vs Subagents: Where Should Each One Live?
Der Artikel "Claude Code Skills vs Slash Commands vs Subagents: Where Should Each One Live?" thematisiert die optimale Strukturierung von Claude Code-Anweisungen, um die Überfüllung der Datei CLAUDE.md zu vermeiden. Entwickler neigen dazu, nützliche Anweisungen in dieser Datei zu sammeln, was zu einer unübersichtlichen Informationsansammlung führt. Der Autor empfiehlt, verschiedene Mechanismen wie CLAUDE.md, Skills, Subagenten und Plan Mode gezielt zu nutzen. CLAUDE.md sollte allgemeine Projektinformationen enthalten, während Skills für wiederverwendbare Verfahren wie Checklisten vorgesehen sind. Subagenten sind für spezialisierte Aufgaben gedacht, die eine eigene Kontextualisierung erfordern. Plan Mode ermöglicht es, komplexe Änderungen im Voraus zu planen. Diese differenzierte Herangehensweise erhöht die Effizienz und Klarheit der Entwicklungsarbeit, indem jede Anweisung an ihrem richtigen Platz organisiert wird.
Arbitrator Rules Gemini Not At Fault For Collapse Of Earn Lending
Ein Schiedsrichter hat entschieden, dass die Kryptowährungsbörse Gemini nicht für den Zusammenbruch ihres Earn-Lending-Programms verantwortlich ist. In seiner Entscheidung stellte er fest, dass Gemini, unter der Leitung der Winklevoss-Zwillinge, keine Täuschung gegenüber den Nutzern begangen und keine Nachlässigkeit bei Due-Diligence-Prüfungen gezeigt hat. Die Klage wurde von Investoren eingereicht, nachdem das Programm 2022 gescheitert war, wobei massive Betrügereien des Partners Genesis als Hauptursache identifiziert wurden. Genesis hatte zuvor eine Geldstrafe von 38,5 Millionen US-Dollar an die SEC gezahlt. Das Earn-Programm, das 2021 gestartet wurde, bot Nutzern bis zu 7,4 % jährliche Zinsen, bevor die Auszahlungen gestoppt wurden und ein Rechtsstreit mit über 300.000 Nutzern folgte. Gemini einigte sich im Februar 2024 mit Genesis und zahlte 2,18 Milliarden US-Dollar an digitale Vermögenswerte zurück, was 97 % der geschuldeten Beträge entspricht. Trotz dieser Rückzahlungen ist der Aktienkurs von GEMI seit dem Börsengang um 87 % gefallen und liegt derzeit bei 4,30 US-Dollar pro Aktie.
A Few Tips to Cut Claude Code Token Costs
Der Artikel "A Few Tips to Cut Claude Code Token Costs" bietet praktische Strategien zur Senkung der Token-Kosten bei der Nutzung von Claude Code. Er erläutert, dass jede Anfrage aus drei Schichten besteht: dem Systemprompt, dem Projektkontext und der Konversationshistorie, wobei Letztere oft die höchsten Kosten verursacht. Um die Token-Nutzung zu optimieren, wird empfohlen, den Projektkontext in der Datei CLAUDE.md zu straffen und nur relevante Informationen zu speichern. Zudem sollten spezifische Anweisungen in Skills ausgelagert und unnötige Tools sowie Serververbindungen deaktiviert werden, um den Kontext zu minimieren. Der Artikel betont auch die Wichtigkeit einer kompakten Konversation zur Kostensenkung und warnt vor den erhöhten Cache-Kosten bei längerer Inaktivität. Abschließend wird geraten, die Token-Nutzung regelmäßig zu überwachen, um ineffiziente Praktiken zu identifizieren und gezielt zu optimieren.