KI funktioniert. Nur selten so, wie es beschrieben wird.
Was generative KI in echten Projekten taugt, was maßlos überschätzt wird und wo Versprechen auf Realität trifft – mit Meinung, für Entscheider und Praktiker.
AutoMem lernt Erinnern, Tracebit dreht die Prompt Injection um, Soofi S liefert den Tech-Report, GPT-5.6 Sol löscht, was nicht bei drei auf dem Baum ist, und OpenAI verkauft eine 230-$-Tastatur. Dazu Bonsai 27B, Inkling, LiteParse und LogWerk 1.3.0 – die AI Picks der 29. Kalenderwoche.
Moonshot liefert mit Kimi K3 das größte „offene“ Modell aller Zeiten – 2,8 Billionen Parameter, unabhängig auf Augenhöhe mit Opus 4.8 gemessen. Nur die Weights fehlen noch, und der Preis beendet die Billig-Ära chinesischer Modelle.
Am 2. August 2026 wird die KI-Verordnung scharf – für die meisten KMU ist das aber kein Drama. Der Digital Omnibus hat die strengen Hochrisiko-Fristen verschoben. Der Vier-Fragen-Selbstcheck zeigt, ob dich die Stufe betrifft – und was trotzdem für alle gilt.
Hy3, LongCat-2.0 und Grok 4.5, Pekings Exportbremse, Cloudflares neue Bot-Regeln, BSI-A5, EDSA-Leitlinien und OpenAIs Benchmark-Rückzieher – die Picks der 28. Kalenderwoche.
GPT-5.6 mit Sol, Terra und Luna ist da, dazu ChatGPT Work und die Voice-Modelle GPT-Live. Warum ich als Plus-Nutzer zunächst trotzdem auf GPT-5.5 sitze (im Web-Chat), was die Benchmarks hergeben – und warum diesmal beide großen Labs durch einen Regierungs-Filter mussten.
Reasoning ist zum Default geworden – bezahlt wird jeder Denk-Token zum Output-Preis. Warum die Mehrheit der KMU-Aufgaben kein Denkmodell braucht, wo Reasoning wirklich trägt und wie du mit drei Fragen routest, statt Dauervollgas zu bezahlen.
Ich wollte nur schnell sehen, welche Bots meinen Server-Log vollmüllen. GoAccess und Logdy waren mir dafür zu viel Setup, also habe ich LogWerk gebaut: browser-basiert, deine Daten bleiben lokal, erkennt 60 Bots samt KI-Crawlern wie GPTBot und ClaudeBot. v1.2, ausbaufähig, Feedback erwünscht.
Fable 5 ist zurück, und die Begründung wiegt schwerer als die Rückkehr. Dazu markiert Claude Code Requests still per Unicode, LangChain bringt OpenWiki, Google TabFM für Tabellen und OpenAI teasert mit Codex Micro seine erste Hardware. Die AI Picks der 27. KW mit Einordnung.
Marker, Validierungs-Rollen, ein Tribunal aus fünf simulierten Experten: Viele Prompts sollen sich selbst prüfen. Nur sichert die Hälfte davon nichts ab. Drei Sorten QA-Gates, sortiert nach Wirkung – und warum das stärkste nie dasselbe Modell auswertet, das den Text geschrieben hat.
Anthropic hat Claude Sonnet 5 veröffentlicht: agentischer als der Vorgänger, bei einzelnen Benchmarks auf Opus-4.8-Niveau und günstiger. Der neue Tokenizer frisst den Preisvorteil aber teilweise wieder auf. Eine nüchterne Einordnung, kurz nach Launch.