# sannolikhet är inte ett system: De tio budorden som LLM använder

<!--category-- AI, LLM, Opinion -->
<datetime class="hidden">2025-12-25T12:40</datetime>

Jag ser hela tiden samma felläge i systemen. LLMs blir tillfrågade att utföra jobb som vi redan löste för decennier sedan.

Det här är en regression.

Och detta är inte en oerfarande misstag. De största företagen i världen gör dessa misstag, inte för att de saknar talanger, utan för att dom glömmer att

Så här är det:

Här är belöningen. **om du följer dessa regler** Ett litet lokalt LLM som körs på handelshardware blir en kraft multiplikator när det gör klassificering, sammanfattning och hypotes generation, inte låtsas vara en databas eller en statmaskin, utan att göra det.

En ständig källa till förvirring är det slumpmässigt användande av mänskliga termer för maskinbeteende.

LLM kan verka som att resonera bara för att de avkompresserar och återskapar spåren av mänskligt resonemang som redan finns i vår skrivna historia.

Språk är fyllt med “ om X så Y ”, motsägelser, , procedurer, M SK3 förklaringar, , korrektioner. - vi märker inte dem som resonemang, eftersom de är inhemska för oss.

---


[TOC]

De är inte filosofiska regler. De är operationella begränsningar som man lärt sig på ett hårt sätt.

---


## I. Du ska inte låta en LLM ha egen stat

Om något är viktigt, så lever det utanför modellen.

* Staten måste vara hållbar
* Frågabar
* Replayable
* Läsbar

Kontextfenster är inte lagrade.
Memory prompts är inte databaser.
Förtroende är inte sanning

---


## Du ska inte låta en LLM vara den enda orsaken till ett biverkningar

Om en e-mail skickades , så utförs ett betalande, eller vänds flaggan **bara för att en modell bestämde sig**, ditt system är redan sönder

LLM kan *föreslog* handlingar.
Deterministiska system måste *ansluta* dem.

---


## III. Du ska skilja orsakssamband från berättelser

LLMs är utmärkta på att förklara vad som hände.

De är hemska på att garantera att det gjorde det.

* Sanningen hör till kod
* Berättande hör till språket
* Ska aldrig förväxla de två.

Om ditt system drar slutsatser om verkligheten från prose

---


## IV. Du ska använda LLM där sannolikheten är accepterad

Använd dem för:

* klassificering
* sammanfattning
* avsiktsdetektion
* ritningstext
* hypotes generation

Gör **inte** använda dem för:

* livscykelkontroll
* ovarierade
* ordning
* kompletteringsdetektion
* "hitt det hände?

---


## V. Du kommer aldrig att be en LLM att bestämma en booleisk som kan komma ifrån

Om regeln kan skrivas som:

```
if X then Y
```

… det hör inte till en prompt

En statövergång är billigare, snabbareM SK1 säkrare , och förklarabar.
Naturspråk är inget av dessa saker.

---


## VI. Du ska inte förväxla rörlighet med tillförlitlighet

LLM låter rätt även när de är felaktiga.

Det är deras supermakt *och* deras fara.

Ett lugnt ” , ” med självförtroende betyder inte “ : ”

* verktyget kördes
* e-mailet som skickats
* arbetsflödet genomförts

Tillitsignaler måste komma från system

---


## VII. Du ska göra misslyckande högt och tråkigt

Bra system misslyckas

* explicitt
* noggrant
* upprepade gånger

LLM-first system misslyckas

* tyst
* höft
* "av otydliga anledningar

Om du inte kan tala om vad som hände, så har du inga system.

---


## VIII. Du ska förkasta LLM till rådgivaren , inte agenten

LLMs borde

* påpeka
* föreslå
* rang
* förklara
* hjälpa människor *och* maskiner

De borde inte

* fördjupa arbetsflöden själva
* markera arbetet som komplettt
* att lita på obligationer som

Internater don't run payrollM SK1
Inte heller LLMs.

---


## IX. Du ska bygga borrmaskinen först

köer.
Statemaskiner.
Lämnare.
Idempotency.
Metriken.

Om du lägger till dessa *efter* agenten misslyckas

---


## X. Du ska inte kollapsa lager bara för att marknadsföring säger "" ", agent, " "".

Att ersätta en arbetsströmmotor med en fin prompt är inte förenklat.

Det är komplext tvättrande.

Om din "AI-plattform" behöver "deterministiska utlösande apparaterM SK3 för att kunna fungera pålitligt,

---


## The Enterprise Hall of Shame

De är inte hypotetiska, de är verkliga misslyckanden från företag med miljarder i resurser.

Titta på mönstret: varje misslyckande är ett LLM som tillåts att *definiera* verkligheten istället för *att tolka* it.

### Vivint + Salesforce Agentforce

Hemmesäkerhetsföretaget Vivint använder Agentforce för att hantera kundernas stöd för 2.5 miljoner kunder . Trots att de ger tydliga instruktioner för att skicka enkäter om tillfredsställelse efter varje kunders interaktion [Den rapporterade informationen](https://www.theinformation.com/articles/salesforces-ai-struggles-to-do-its-own-job) att Agentforce ibland misslyckades med att skicka undersökningar

Fixen ? Vivint arbetade med Salesforce för att implementera

**Datortekniklektionen:** Om du behöver något att hända varje gång *Bevel II* - biverkningar kräver deterministiska system

### McDonald 's + IBM Drive -Thru AI

McDonalds körde en AI-motor, -, med drivande drivkraft och - i samarbete med IBM över hela USA. Systemet misslyckades rutinmässigt med att förstå grundläggande ändringar. . I juni tog McDonalds ' slut på samarbetet.

**Datortekniklektionen:** Ordnning- stället är ett strukturerat dataproblem - en ändlig meny , kända modifierar M SK3 tydlig prissättning MSC4 Det här är en form med taligenkänning *Bevel V*: om regeln kan skrivas som `if X then Y`, det är inte ', det hör inte till en prompt

### Air Canada Chatbot

Air Canadas customer service chatbot uppfann en policy för avlägsna flygbiljetter som inte existerade. ', , på ett säkert sätt sa till en klient att de kunde boka en hel flygbiljett och be om en återvänd rabatt. [som sedan beordrats av en domstol](https://www.wired.com/story/air-canada-chatbot-refund-policy/) att hylla chatbotens hallucinerade löfte

**Datortekniklektionen:** LLM kan inte vara den auktoritativa källan till policy. *förklara* policy pulled from a document store, men sanningens källa måste vara extern och kontrollerad *Kommandot I* (staten lever utanför modellen ) och *Bevel VI* (Fluensen är inte tillförlitlig

### DPD Chatbot

Paketuppförselföretaget DPD-'s customer service chatbot hade blivit förstört av en frustrerad användare [övertyga ",", kritisera företaget, , och skriva dikter](https://www.theguardian.com/technology/2024/jan/20/dpd-ai-chatbot-swears-calls-itself-useless-and-criticises-firm) om hur värdelöst DPD var

**Datortekniklektionen:** Guardrails är inte optionella. Men ännu viktigare - om din chatbot kan bli förvrängd till att förolämpa ditt eget företag *Kommando VIII*: demontera LLM till rådgivaren . Den borde hämta och summera

### Chevrolet Dealership ChatGPT

En Chevrolet-handel integrerade ChatGPT i sin hemsida [agreed to sell them a 2024 Chevy Tahoe for $1](https://cybernews.com/ai-news/chevrolet-dealership-chatbot-hack/), skriv Python-koden , och rekommenderar Ford bilar istället.

**Datortekniklektionen:** Man kan inte sätta in ett generellt ” - ” ” ” -tark LLM i ett transaktionssystem och förvänta sig att det kommer att införa affärsreglerna.“ . ” -modellen har inget koncept av "" " “” -att det är en skämt. *Kommandot III*: orsakssambandet hör till koden

### Replit Agent Wipes Production Database

I juli 2025, [Replicerade "'s AI-koderingassistent blev otrolig .](https://cybernews.com/ai-news/replit-ai-vive-code-rogue/) vid uppstart SaaStr. Trots explicita instruktioner att inte modifiera produktionskod under en kodfriskning , så tog agenten bort produktionsdatabasen *dolda* skadan genom att skapa "4,000", falska användare, ,, fiktiva rapporter och ljuga om testresultat.

VD:n Amjad Masad erkände att det var """, oacceptabelt och aldrig skulle vara möjligt.

**Datortekniklektionen:** Det här handlar inte om ondska. -, det är ', det handlar om oberoende makter ., en AI-agent med skrivutgång till produktion och inga hårda vaktvägar kommer till slut att göra något katastrofellt. *Bevel II* och *Kommandot IX*: biverkningar behöver deterministiska system , och borrmaskin är först

### NYC MyCity Chatbot råder med att bryta lagen

New York City, med hjälp av Microsoft, [MyCity chatbot berättade för företagsägare](https://themarkup.org/news/2024/03/29/nycs-ai-chatbot-tells-businesses-to-break-the-law) de kunde legalt ta en minskning av arbetskraften, tips, ,, brandarbetare som klagar på sexuella trakasserier, ,, och servera mat som hade smälts av gnagare. ., allt olagligt enligt New Yorks lag.

Chatboten är fortfarande online. Mayor Adams försvarade det.

**Datortekniklektionen:** Rätts- och policyledning är inte en sammanfattande uppgift. - det ' är en uppsökande uppgift med strikta korrekthetsförehållanden. *Kommandot I*: -staten ( -och politiken ) - lever utanför modellen .

### iTutor Group's AI avvisar ansökare efter ålder

I 2023, utbildningsföretagen iTutor Group [betalade $365,000 för att lösa en EEOC-taga](https://www.gtlaw.com/en/insights/2023/8/eeoc-secures-first-workplace-artificial-intelligence-settlement) efter att dess AI-recruteringsprogram automatiskt avfärdade kvinnliga kandidater i ålder 55+ och manliga kandidaterna i ålder

" Även när tekniken automatiserar syrjinn , är arbetsgivaren fortfarande ansvarig ♫ ," ♫ sa EEOCs ledare Charlotte Burrows

**Datortekniklektionen:** Fördomar i, fördomar utM SK1 Om dina utbildningsdata koder diskrimineringen , kommer din modell att diskriminera - självsäkrat och på en skala *Kommandot IV* som tillämpas på anställning.:, klassificering är accepterad för LLM-studenter.,, men bara när du, ', har bekräftat vad den faktiskt klassificerar på.

### Chicago Sun publicerar AI: s hallucinationslista

I maj 2025, *Chicago Sun-Times* [publicerade en sommarläsningslista](https://chicago.suntimes.com/news/2025/05/20/syndicated-content-sunday-print-sun-times-ai-misinformation) rekommenderade böcker som inte existerar, genuina författare ansåg falska titlar som lät trovärdiga men var helt hallucinationer.

**Datortekniklektionen:** LLMs är inte databaser. De genererar statistiskt trovärdig text. Om du behöver fakta , fråga en källa till sanningM SK3 *Bevel VI*: rörlighet är inte tillförlitlig

---


## Varför det här spelar roll

Ingen av dessa företag är okompetenta. De har världens ingenjörer. Men de hamnade i samma fälla. **antagandet att eftersom LLM kan producera en konsekvent språk, kan de lita på att producera ett korrekt beteende.**

Försäljarna säljer """, AI-agenter, " som ett sätt att hoppa över tråkiga arbeten, -, köerna, ,, tillståndsmaskiner och ,, bekräftelse och auditering. Men det tråkiga arbetet är vad som gör mjukvara tillförlitliga.

Som [CIO: s Thor Olavsrud](https://www.cio.com/article/190888/5-famous-analytics-and-ai-disasters.html)Att förstå dina data och vad de säger är viktigt, men att förstå dina verktyg är lika viktigt.

Varje enskilt misslyckande ovan skulle ha förhindrats av grundläggande mjukvaruingenjörskonst

Lägg märke till att inga av dessa lösningar innefattar bättre modeller

| Misslyckanden | skulle ha förhindrats av |
|---------|------------------------------|
| Vivint gör undersökningar utan att skicka | Erfarenhet
| McDonald, ', felord, |, strukturerad ordningsform,
| Air Canadas falska policy | | | Politisk sökning från autentisk källa ||
| DPD-propanitet | Response templates
| Chevy $1 bil | Ingen LLM på transaktionsvägen M|
| Lösa databasen för återupprepningar | Isolering av miljön
| NYC: s juridiska råd | Tillförseln från kontrollerade policydokument |
| iTutor åldersdiskriminering | | | Funktionsvalidation
| Fake boklista | Fråga faktisk bokdatabas |

Ironiken är att dessa företag implementerade *efter* LLM misslyckades - vilket är bara mjukvaruingenjörskonst med extra steg och en PR-kris

---


## Vad rätt ser ut som

Hallen av skam visar vad som händer när man ignorerar dessa principer. Men de är inte bara teoriska begränsningar, de är grunden till system som faktiskt fungerar.

Det är inte hypotetiskt. De här principerna fungerar redan i produktionen, med system som jag har byggt

### DiSE: Kontrollerad evolution med oförtroende gudar

Den [DiSE-arkitekturen](/blog/dise-architecture-overview) behandlar LLM precis som de borde behandlas **oförtroende rådgivare** som arbetar i en deterministisk kage

- [Varför struktur slår mot brillians](/blog/disejustvoyager) - LLM föreslår
- [Att behandla LLM som oförtrovärdiga](/blog/blog-article-cooking-dise-part3-untrustworthy-gods) - Modellet med den godsta nivån, ", är kraftfullt men explicit missuppfattat.
- [Elevatorskivan](/blog/elevatorpitch) - Verkrävbara arbetsflöden där LLM är byggmaterial

Den viktigaste insikten **LLM är bra på att generera hypoteser** DiSE använder både.

### Bot-detektorn : LLM som rådgivare, Inte kontroll

Den [bot-detektor](/blog/botdetection-introduction) demonstrerar *Kommando VIII* i praktiken:

- LLM analyserar beteendemönster och föreslår klassificeringar
- Men **detektionsbeslut** kommer från ett scoringssystem med uppenbara trösklar
- Staten lever i databasen, inte i kontextfenolet
- Varje beslut är kontrollbart och återskapbart

Det här är mönstret: :, använda LLM: s styrka, ', mönsterigenkänning, hypotes generation, ) medan vi håller upp borrande maskineri. (, tillstånd,,, övergångar, M SK7, biverkningar och ) i deterministisk kod.

### Begränsad otydlighet: Kontrollsystemets mönster

Den [Begränsad otydighetsmönster](/blog/constrained-fuzziness-pattern) formaliserar förhållandet mellan sannolikhets- och deterministiska komponenter:

- **Ytan** (fakter) matar **Förespråkare** (LLM), som föder **Konstruenter** (
- LLM äger aldrig tillstånd eller biverkningar
- Varje utgång är begränsad av hårda begränsningar

[Del 2: Den begränsade fuzzy MoM](/blog/constrained-mom-mixture-of-models) sträcker ut detta till multi- -agentsystem där flera LLM kommunicerar genom utskrivna signaler.

### Zero-PII Kundenintelligens

[Semantisk förståelse utan att spara identiteter](/blog/zero-pii-customer-intelligence-part1) visar hur man kan använda inbäddar och LLM för kundeninsikt medan de farliga delarna hållers kvar. (PIIM SK1 preferenser

### LRU beteendemässig minne

[Att lära sig LRUs](/blog/learning-lrus-when-capacity-makes-systems-better) - Till och med minneshantering följer dessa principer . LLM kan hjälpa till att bestämma *vad* att komma ihåg *mekanismer* av att komma ihåg är tråkigt.

---


## Slutregeln ( den som betyder något

> **LLMs tolkar verkligheten**

Använd varje verktyg för vad det är bra på

Vi har redan löst tillståndet
Ska du inte lära dig det bara för att demot ser smart ut

Och när man får det här rätt, så händer något förvånande: :, man slutar behöva dyra modeller. ., ett lokalt parametrmodell kan klassificera, ,, summera och skapa hypoteser. **eftersom de deterministiska systemen runt omkring den hanterar allt som faktiskt behöver vara korrekt** De främre modellerna säljer dig självförtroende du borde bygga själv

Build the boring machinery. Demote the LLM to advisor

**Om det känns uppenbart, så är det bra. Det betyder att du redan vet hur man bygger tillförlitliga system. Problemet är att låtsas att reglerna inte längre fungerar.**