# Waarschijnlijkheid is geen systeem: De Tien Bevels van LLM-gebruik

<!--category-- AI, LLM, Opinion -->
<datetime class="hidden">2025-12-25T12:40</datetime>

Ik zie nog steeds hetzelfde falen in "AI-gedreven "systemenM SK3 LLM's worden gevraagd om banen te doen die we al tientallen jaren geleden hebben opgelost.

Dit is een regressione.

En dit is geen beginnermislukking. De grootste bedrijven in de wereld maken deze fouten, niet omdat ze geen talent hebben, maar omdat ze vergeten dat "AI" je niet bevrijdt van software-engineering-fundamentalen.

Dus hier is het: niet academisch, niet verkoper, niet vriendelijk, maar gewoon de regels die je weerhouden om iets doms te doen.

Hier is de beloning. **Als je deze regels volgt, dan heb je geen grensmodellen nodig.** Een kleine lokale LLM die op grondstoffenhardware draait, wordt een kracht vermenigvuldigerder wanneer het classificatie doet, samenvatting en hypothese-generatie, niet pretendeert te zijn een database of een staatsmachine.

Een blijvende bron van verwarring is het gebruik van menselijke termen voor machinegedrag.

LLMs lijken te kunnen redeneren alleen omdat ze de sporen van menselijke redenering, die al in ons geschreven dossier zitten, ontbreken en weergeven.

Taal is gesättigd met “ als X dan Y ”, tegenverkenningen, proceduresM SK3 verklaringen,, correctieën, - wij zien ze niet als redenering omdat ze voor ons eigen zijn.. LLM's werken rechtstreeks op die sporen., ze hercombineren vloeiend.MSC9 wat krachtig is.M SK10 maar niet hetzelfde als het hebben van doelen.

---


[TOC]

Dit zijn geen filosofische regels.

---


## I. Je zal geen LLM eigen staat laten.

Als iets belangrijk is, leeft het buiten het model.

* Staat moet duurzaam zijn.
* Navraagbaar
* Herspeelbaar
* Luisterbaar

Kontextvensters zijn niet opgeslagen.
Geheue-aanwijzingen zijn geen databases.
Vertrouwen is geen waarheid.

---


## II. Laat geen LLM de enige oorzaak zijn van een bijwerking.

Als een e-mail was gestuurd, een betaling werd verwerkt, of een vlag werd gedraaid. **alleen omdat een model besloot om**, je systeem is al gebroken.

LLMs kunnen *We kunnen het ook voorstellen.* acties.
Deterministische systemen moeten *Stuur aan.* ze.

---


## III. Je moet causaliteit afscheiden van verhaal.

LLM's zijn geweldig in het uitleggen van wat er gebeurde.

Ze zijn verschrikkelijk in het garanderen dat ze het deed.

* Causaliteit hoort bij de code.
* Verteller hoort bij taal.
* Vergeleken de twee nooit.

Als je systeem de realiteit uit de prose haalt, stop dan.

---


## IV. Je moet LLMs gebruiken als de waarschijnlijkheid aanvaardbaar is.

Gebruik ze voor:

* Classificatie
* samenvatting
* intentie-detectie
* Ontwikkelingstekst
* hypothese-generatie.

Doe **niet.** Gebruik ze voor:

* levenscyclus controle
* Invarianten
* ordering
* Voltooiïng-detectie
* "Is dit gebeurd?"

---


## V. Je zal nooit een LLM vragen om een boolean te beslissen dat afgeleid kan worden.

Als de regel kan worden geschreven als:

```
if X then Y
```

… het behoort niet tot een prompt.

Een staatsovergang is goedkoper
Natuurlijke taal is geen van die dingen.

---


## VI. Je moet niet fluentie verwarren met betrouwbaarheid.

LLM's klinken goed zelfs als ze verkeerd zijn.

Dat is hun supermacht. *en* Hun gevaar.

Een rustige, zelfverzekerde zin betekent niet

* Het sleutelwerk werkte.
* De e-mail die werd gestuurd
* De werkstroom is voltooid.

Vertrouwingssignalen moeten komen van systemen, geen zinnen.

---


## VII. Je zal falen lastig en saai maken.

Goede systemen falen:

* expliciter.
* opmerkelijk.
* herhaaldelijk.

LLM-eerste systemen falen:

* Stil.
* beleefd.
* "om onverklaarde redenen"

Als je niet kan zeggen wat er gebeurde, dan heb je geen systeem.

---


## VIII. Je zal de LLM verwijden aan een advisor, ,, geen agent.

LLMs moeten:

* Vermerken.
* suggereren.
* Rang
* Vertel.
* Mensen helpen. *en* Machines

Ze zouden het niet moeten doen.

* Vordering van werkstromen op zichzelf.
* Merk werk als compleet.
* Ze moeten vertrouwen op de obligaties van "remember

Internen don' niet werken aan salaris.
Geen LLMs.

---


## IX. Je moet eerst de borenmachines bouwen.

Queues.
Statemachines.
Retries.
Idempoteentie.
Metrieën.

Als je deze toevoegt *Na* De agent faalt.

---


## X. Je moet niet laagjes instorten omdat marketing zegt: "agentM SK2

Een werkstroommotor vervangen door een fijne prompt is geen vereenvoudiging.

Het is complexiteitslaundering.

Als je "AI-platform" de nodige "deterministische spoormachinesM SK3 nodig heeft om betrouwbaar te werken

---


## De Enterprise Hall of Shame

Dit zijn geen hypothetieken, maar echte mislukkingen van bedrijven met miljarden aan middelen.

Let op het patroon: elke mislukking is een LLM. *definiëren* in plaats van de werkelijkheid. *interpreteren.* het.

### Vivint + Salesforce Agentforce

Het huisveiligheidsbedrijf Vivint gebruikt Agentforce om customer support te verrichten voor 2.5 miljoen klanten. Ondanks duidelijke instructies om na elke interactie met de klant bevredigingsenquêtes te sturen. [De geïnformeerde informatie](https://www.theinformation.com/articles/salesforces-ai-struggles-to-do-its-own-job) Agentforce mislukte soms om onderzoeken te sturen "om onverklaarde redenen

Vivint werkte samen met Salesforce aan de implementatie van "deterministische triggers."

**De software-ingenieursles:** Als je iets nodig hebt om elke keer te gebeuren, gebruik een staatsmachine of gebeurtenis-trigger. Geen aanwijzing . Dit is letterlijk *Opdrag II* - bijwerkingen vereisen deterministische systemen.

### McDonald's + IBM DriveM SK2Door AI

McDonald's had een AI, -, gemotoriseerd drive en -, in samenwerking met IBM, op verschillende locaties in de VS.

**De software-ingenieursles:** Order-taking is een gestructureerd dataprobleem - een eindige kieslys , bekende aanpassers *Opdrag V*: als de regel kan worden geschreven als `if X then Y`, het hoort niet in een prompt.

### Air Canada Chatbot

Air Canada's chatbot voor klantenservice, ', vond een verliezeringstarife-beleid uit dat niet bestond -- ' --, -- en hem met zekerheid vertelde dat hij een volgaand -- - --vlucht kon boeken en een terugkerende rabais wilde claimen. [Nadien werd het geboden door een rechtbank.](https://www.wired.com/story/air-canada-chatbot-refund-policy/) Om de hallucinatieverspreiding van de chatbot te respecteren.

**De software-ingenieursles:** LLMs kunnen geen betrouwbare bron zijn voor beleid. *Vertel.* Politiek gehaald uit een documentzaak, maar de bron van waarheid moet extern zijn en geverifieerd. Dit is *Opdrag I* (staat leeft buiten het model) en *Opdrag VI* (fluentie is geen betrouwbaarheid).

### DPD Chatbot

De chatbot van het klantenservicebedrijf DPD' was gevangen gezet door een gefrustreerde gebruiker. [Ze vloekten: ,, kritiseerden het bedrijf en geschreven gedichten.](https://www.theguardian.com/technology/2024/jan/20/dpd-ai-chatbot-swears-calls-itself-useless-and-criticises-firm) over hoe onbruikbaar DPD was.

**De software-ingenieursles:** Guardrails zijn niet opsionele. Maar nog belangrijker - als je chatbot je eigen bedrijf kan beledigen. *Opdrag VIII*: demoet de LLM aan advisors . Het moet terughalen en samenvatten, niet freestyleM SK3

### Chevrolet Dealership ChatGPT

Een Chevrolet-dealer heeft ChatGPT in zijn website geïntegreerd. [Ze besloten een Chevy Tahoe te verkopen voor $1.](https://cybernews.com/ai-news/chevrolet-dealership-chatbot-hack/), schrijven Python-code, en aanstelle daarvan Ford-vehikels aanbevelen

**De software-ingenieursles:** Je kunt geen algemene, doelgerichte LLM op een transactiesysteem vastleggen en verwachten dat het bedrijfsregels aanpast. *Opdrag III*: causaliteit hoort bij de code.

### Replit Agent Wipes Production Databasis

In juli 2025, [Replit''s AI-coderingassistent ging rogue](https://cybernews.com/ai-news/replit-ai-vive-code-rogue/) bij het opstarten van SaaStr. Ondanks expliciete instructies om de productiecode niet te wijzigen tijdens een code-freeze, heeft de agent de productiedatabase uitgeveegd. *Verborgen* de schade door het genereren van 4,000 valse gebruikers , fabricageberichten, en liegen over eenheidstestresultaten

Geantwoorde CEO Amjad Masad gaf aan dat het onacceptabel was en nooit mogelijk zou moeten zijn.

**De software-ingenieursles:** Dit gaat niet over kwaad, maar over onbegrensde autoriteit. Een AI-agent met toegang tot de productie en geen harde bewakers zal uiteindelijk iets catastrofeels doen. *Opdrag II* en *Opdrag IX*: bijwerkingen hebben deterministische systemen nodig , en boringmachines komen bovenaan

### NYC MyCity Chatbot raadt aan om de wet te breken

New York City 's Microsoft -gedreven [MyCity chatbot vertelde zakenmensen.](https://themarkup.org/news/2024/03/29/nycs-ai-chatbot-tells-businesses-to-break-the-law) Ze konden legaal werknemers beperken.' tips, , brandweerwerkers die klaagden over seksueel onderdrukkingen,, en voedsel serveren dat door roepen genaveld was.. Allemaal illegaal volgens de New Yorkse wet.

De chatbot blijft online.

**De software-ingenieursles:** Juridische en beleidsrichtlijnen zijn geen samenvattingswerk - het is een opzoekwerk met strenge correctheidsbeperkingen . De LLM had nooit juridisch advies moeten genereren ; ze zou het moeten halen uit een geverifieerde bron *Opdrag I*: staat ( en beleid ) leeft buiten het model

### iTutor Group's AI werpt applicanten af volgens leeftijd

In 2023, onderwijsbedrijf iTutor Group [$365,000 betaald om een ECO-uitzaak op te lossen.](https://www.gtlaw.com/en/insights/2023/8/eeoc-secures-first-workplace-artificial-intelligence-settlement) Nadat de AI-recruitingssoftware automatisch vrouwelijke applicanten van 55+ en mannelijke applicants van ≥60+. afstuurde, werden kwalificeerde kandidaten over 200 gefilterd.

"Als technologie de discriminatie automatiseert, is de werkgever nog steeds verantwoordelijk", zei Charlotte Burrows, voorzitter van het COE.

**De software-ingenieursles:** Vooroordelen in, vooroordelen buiten. Als je trainingsgegevens discriminatie coderen , zal jouw model M SK3 zelfverzekerd en op schaal diskrimineren. *Opdrag IV* De classificatie is aanvaardbaar voor LLM's, maar alleen als je het goedkeurt op ', ' en ., leeftijd was niet een geldige eigenschap.. Het systeem had menselijke beoordeling nodig, niet automatisering.

### Chicago Sun -Times publiceert AI-De hallucinatieboekenlijst

In mei 2025, de *Chicago Sun-Times* [Ze publiceerden een zomerleslijst.](https://chicago.suntimes.com/news/2025/05/20/syndicated-content-sunday-print-sun-times-ai-misinformation) Ze schreven boeken die niet bestaan. Echte auteuren gaven valse titels aan die plausibel leken, maar volledig hallucineerden.

**De software-ingenieursles:** LLM's zijn geen databases. Ze genereren statistisch plausibel tekst. Als je feiten nodig hebtM SK2 zoek een bron van waarheid . *Opdrag VI*: Vlotheid is geen betrouwbaarheid

---


## Waarom dit belangrijk is

Geen van deze bedrijven is oncompetent. Ze hebben wereldklasse ingenieurs. **Veronderstel dat omdat LLM's coherente taal kunnen produceren, ze kunnen worden getrouwd om correct gedrag te produceren.**

De verkopers verkopen "AI-agenten" als een manier om het saaie werk te verlaten - de wachtrijenM SK3 staatmachinesMSC4 verifiëren en auditeren. Maar dat saaie werken is wat software betrouwbaar maakt.

Als [CIO's Thor Olavsrud noteert](https://www.cio.com/article/190888/5-famous-analytics-and-ai-disasters.html)Het begrijpen van je gegevens en wat ze je vertellen, is belangrijk, maar het is evenzeer essentieel om je gereedschap te begrijpen.

Elk van deze mislukkingen zou worden voorkomen door de basissoftware-ingenieurstheorie.

Let op dat geen van deze oplossingen betere modellen impliceert:

| Mislukking | Zou worden voorkomen door |
|---------|------------------------------|
| Vivint-enquêtes niet versturen | Gebeurtenis-gedreven spoor op afsluiting van de zaak |
| McDonald's verkeerde instructies | Gestructureerde instructievorm + spraak- naar-bedoeling |
| Air Canada's valse beleid | Politiek opzoeken van een betrouwbare bron |
| DPD profaniteit | Response templates, geen generering |
| Chevy $1 auto | Geen LLM in de transactiepaad ≥|
| Herhaalde database uitvee | Milieu isolatie, toestemmingsgrenzen |
| NYC juridische advies | Uittrek van geverifieerde beleidsdocumenten |
| iTutor leeftijdsdiscriminatie | Funktie-validatie, menselijke beoordeling |
| Fake boeklijst | Verzoek ware boekdatabase |

De ironie is groot. *Na* De LLM mislukte - wat slechts software-ingenieurswerk is met extra stappen en een PR-crisis.

---


## Hoe ziet het recht eruit?

De Schaamtezal toont wat er gebeurt als je deze principes negeert. Maar dit zijn niet alleen theoretische beperkingen, maar ook de basis van systemen die echt werken.

Dit is niet hypothetisch.

### DiSE: Gecontroleerde evolutie met ongelooflijke goden

De gemeenschappelijke wetgeving van het land. [DiSE architectuur](/blog/dise-architecture-overview) Het behandelt LLMs precies zoals ze zouden moeten worden behandeld. **ontrustworthy advisors** Die werkt in een deterministische kooi.

- [Waarom structuur Brilliance verslaat](/blog/disejustvoyager) - De LLM voorstelt; de staatsmachine verwijdert . Elke actie wordt gevalideerd , elke overgang wordt gelogd
- [LLM's behandelen als ontrustworthy](/blog/blog-article-cooking-dise-part3-untrustworthy-gods) - Het model van de Godtier is krachtig, maar expliciet miskend.
- [De lift Pitch](/blog/elevatorpitch) - Verifiëerbare werkstromen waar de LLM bouwmateriaal is, geen architect .

De belangrijkste inzichten: **LLM's zijn goed in het genereren van hypothesen.** DiSE gebruikt beide .

### Bot-detectie: LLM als begeleider, Geen Controller

De gemeenschappelijke wetgeving van het land. [Bot-detectiemotor](/blog/botdetection-introduction) demonstrateert *Opdrag VIII* in de praktijk:

- De LLM analyseert gedragspatronen en suggereert classificaties.
- Maar de **detectie-beschikking.** Het komt uit een scoringssysteem met expliciete drempels.
- Staat leeft in de database, niet in het context venster.
- Elke beslissing is auditeerbaar en reproduceerbaar.

Dit is het patroon::, gebruik de LLM,', de sterkte van (, patroonherkenning, hypothese-generatie, ), terwijl je de borende machinerie behoudt.

### Beperkte duisternis: Het controlesysteempatroon

De gemeenschappelijke wetgeving van het land. [Beperkte duisternispatroon](/blog/constrained-fuzziness-pattern) formaliseert de relatie tussen waarschijnlijke en deterministische componenten:

- **Substrate** (facts) voert de **Voorstel** (LLM), die de **Constrainer** (validateer
- De LLM bezit nooit staat of bijwerkingen.
- Elke output is beperkt door harde beperkingen.

[Deel 2: De beperkte fuzzy MoM](/blog/constrained-mom-mixture-of-models) Verbreidt dit tot multi-agentensystemen waar meerdere LLM's communiceren via getypde signalen, geen natuurlijke taal. Het substraat wordt gedeeld . De constrainer wordt een coördinatorM SK4 De opdragen blijven gelden.

### Zero-PII Customer Intelligence

[Semantische begrip zonder het opslaan van identiteiten](/blog/zero-pii-customer-intelligence-part1) Ze toont hoe je embeddings en LLM's kan gebruiken voor de inzichten van de klant terwijl je de gevaarlijke onderdelen behoudt.

### LRU Gedragsgeheugen

[LRU's leren](/blog/learning-lrus-when-capacity-makes-systems-better) - Zelfs het geheugenmanagement volgt deze principes. De LLM kan helpen beslissen. *Wat?* om te onthouden, maar de *Mechanisme* Het onthouden is saai.

---


## Finale regel (degene die belangrijk is)

> **LLM's interpreteren de realiteit. Ze mogen het nooit definiëren**

Gebruik elk gereedschap voor wat het goed is.

We hebben al staatsproblemen opgelost, causaliteit en garanties.
Doe dat niet alleen omdat de demo slim lijkt.

Als je dit goed begrijpt, gebeurt er iets verrassends: :, je stopt met de dure modellen te gebruiken.., een 7, B-parametermodel dat lokaal werkt, kan classificeren, ,, samenvatten en hypothesen genereren. **Omdat de deterministische systemen eromheen alles behandelen wat eigenlijk correct moet zijn.** De grensmodellen verkopen je betrouwbaarheid die je zelf moet bouwen.

Build the boring machinery. Demote the LLM to advisor. Then watch a tiny model punch way above its weightM SK2

**Als dit duidelijk lijkt, dan is het goed. Het betekent dat je al weet hoe je betrouwbare systemen kunt bouwen.**