Back to "Probabilità non è un sistema: I dieci comandamenti dell'uso del LLM"

This is a viewer only at the moment see the article on how this works.

To update the preview hit Ctrl-Alt-R (or ⌘-Alt-R on Mac) or Enter to refresh. The Save icon lets you save the markdown file to disk

This is a preview from the server running through my markdig pipeline

AI LLM Opinion

Probabilità non è un sistema: I dieci comandamenti dell'uso del LLM

Thursday, 25 December 2025

Io continuo a vedere lo stesso modo di fallimento nei sistemi "AI-poweredM SK2systems : Gli LLM vengono chiamati a fare lavori che abbiamo già risolto decenni fa.

Questo non è ' non è un punto di svolta . È una regressione

E questo non è un errore per i principianti. Le più grandi aziende del mondo fanno questi errori, non perché mancano di talento, ma perché hanno dimenticato che l'ingegneria software non vi esclude dagli elementi fondamentali.

Quindi eccolo qui. Non accademico. Niente venditoreM SK2 amichevole . Solo le regole che ti impediscono di fare qualcosa di stupido.

Questo è il risultato. Se seguite queste regole, non c'è bisogno di modelli frontiere'non ci servono modelli frontieriM SK2 Un piccolo LLM locale che funziona su hardware di merci diventa un moltiplicatore di forza quando fa la classificazione, la sommificazione e la generazione delle ipotesi, non fingendosi di essere una base di dati o una macchina dello stato.

Una fonte persistente di confusione è l'uso casuale dei termini umani per il comportamento delle macchine.

I LLM possono sembrare razionali solo perché decomprimono e riproducono le tracce del ragionamento umano già inserite nella nostra memoria scritta.

La lingua è saturata di “ se X allora Y”, controfactualiM SK2 procedure , spiegazioniM Sk4 correzioni - non li notiamo come ragionamento perché sono nativi per noiM sk7 LLM operano direttamente su quelle tracce M Sk8 ricombinandoli flessivamente M sk9 che è potente M SK10 ma non la stessa cosa dell'ottenere obiettivi M K11 intenzioni M k12 o agenzia M S K 13 Non c'è decisione interna Mk 14 maker MK 15 nessuna capacità di scegliere gli obiettiviM K 16 nessuna responsabilitàM S K 17 Trattare la continuazione del modello come agenzia è un errore di categoriaM k 18 e progettare i sistemi come se fossero reali è il modo in cui i motori della probabilità vengono promuovati nella decisione di produzioneMk 19 makersMK 20 Questo errore non rende i sistemi più intelligenti M MK 22 semplicemente rende più difficile diagnosticare i fallimentiM MK 23


Queste non sono regole filosofiche.


I. Non lasci che un LLM abbia il proprio stato

Se qualcosa è importante, vive fuori dal modello.

  • Lo stato deve essere duraturo.
  • La domandabile
  • Replayable
  • Auditoribile

Le finestre del contesto non sono state conservate. I richiami di memoria non sono database. La fiducia non è vera.


II. Non lasci che un LLM sia la sola causa di un effetto collaterale.

Se è stato inviato un email, un pagamento processato, o una bandiera rotta Solo perché un modello ha deciso di, il vostro sistema è già rotto.

I LLM possono: Ricommandare azioni. I sistemi deterministici devono mettersi in contatto. them.


III. Separate la causalità dalla narrazione

I LLM sono eccezionali nel spiegare cosa è successo.

Sono terribili nel garantirlo.

  • La causalità appartiene al codice.
  • La narrazione appartiene alla lingua.
  • Non confondere le due cose.

Se il vostro sistema inferisce la realtà dalla prose, stop.


IV. Usate LLM dove la probabilità è accettabile

Usateli per:

  • Classificazione
  • riassunto
  • Identificazione dell'intento.
  • il testo di disegno
  • Generazione di ipotesi.

Faccia Non. Usateli per:

  • Controllo del ciclo vitale.
  • Invarianti
  • ordinare
  • Detezione completa
  • "È successo?

V. Non chiederai mai a un LLM di decidere un boolean che può essere derivato.

Se la regola può essere scritta come:

if X then Y

…non appartiene ad un prompt.

Una transizione statale è più economica, più veloceM SK1 più sicura , e spiegabile. Il linguaggio naturale non è una di queste cose.


VI. Non scambiate la flessibilità con la affidabilità.

I LLM suonano bene anche quando sono sbagliati.

Questo è il loro superpotere. e il loro pericolo.

Una frase tranquille, convincente non significa:

  • L'outil è andato avanti.
  • l'email inviato
  • il flusso di lavoro terminato

I segnali di fiducia devono venire dai sistemi, non dalle frasiM SK1


Il fallimento sarà rumoroso e noioso.

I buoni sistemi falliscono:

  • esplicitamente.
  • Osservabilemente.
  • ripetutamente.

LLM-failo dei primi sistemi:

  • in silenzio.
  • politamente.
  • "per ragioni non spiegateM SK1

Se ' non sai cosa è successo ' non è successo, non hai un sistema ' non c'è un sistema


VIII. Dovresti ridare il LLM a un consulente, non ad un agente.

I LLM dovrebbero:

  • annotare
  • suggerire
  • rialzarsi.
  • spiegare.
  • Assistere gli umani. e i macchinari

Non dovrebbero:

  • avanzare i flussi di lavoro da soli.
  • Notate il lavoro come completo.
  • essere affidati alle obligazioni "rememberM SK1.

Gli ingegneri non lavorano con la salta di paga. E nemmeno i LLMs.


IX. Tu costruisci prima la macchina da gettare.

Queue. Maschine di stato. Reti. Idempotenze. Metrica.

Se aggiungete queste dopo. L'agente fallisce.


X. Non colperi strati solo perché il marketing dice "agenteM SK2

Sostituire un motore per il flusso di lavoro con una fine promptazione calibrata non è semplificazione.

È il riciclaggio della complessità.

Se la vostra "Plattform AI" ha bisogno di "triggeri deterministiciM SK3 per funzionare in modo affidabile


L'Enterprise Hall of Shame

Queste non sono ipotesi, ma fallimenti reali da aziende con miliardi di risorse.

Notate il modello: ogni fallimento è un LLM che viene permesso di Definire La realtà invece di interpretare it.

Vivint + Salesforce Agentforce

L'azienda di sicurezza a casa Vivint usa Agentforce per gestire il supporto al cliente per 2.5 milioni di clientiM SK1 Nonostante le chiare istruzioni per mandare sondaggi sulla soddisfazione dopo ogni interazione con il cliente, Le informazioni riportate che Agentforce a volte non ha inviato sondaggi "per ragioni non spiegate."

La soluzione? Vivint ha lavorato con Salesforce per implementare M SK1triggeri deterministici."

La lezione di ingegneria del software: Se c'è bisogno di qualcosa che accada ogni volta, usare una macchina dello stato o un trigger per gli eventi. Non un promptM SK2 Questo è letteralmente Comando II - effetti collaterali richiedono sistemi deterministiciM SK1

McDonald's + IBM Drive-Thru AI

McDonald's ha condotto un drive ad AIM SK1powered drive-through ordering system in partnership with IBM across over 100US locationsMSC4 Il sistema di solito non ha capito le modificazioni di baseMST5 Nel giugno M ST6 McDonaldS ST7s è terminato il partnershipSST8

La lezione di ingegneria del software: L'ordine-l'analisi è un problema di dati strutturati - un menu finitoM SK2 modificatori conosciuti , un prezzo chiaroM Sk4 Questa è una forma con il riconoscimento vocaleM sk5 non un compito di ragionamentoMk6 Comandamento V: se la regola può essere scritta come if X then Y, non appartiene a 'non appartiene ad un prompt

Air Canada Chatbot

Il chatbot di servizio al cliente di Air Canada, ', ha inventato una politica di tariffe per i ritardo che non esisteva,',,, dicendo con sicurezza ad un cliente che poteva prenotare un volo a tariffe completa e chiedere un sconto retroattivo. Successivamente ordinato da un tribunale. per onorare la promessa allucinata del chatbot, '.

La lezione di ingegneria del software: I LLM non possono essere la fonte affidabile della politica. Possono spiegare. Policy pulled from a document store, but the source of truth must be external and verified. This is Comandamento I (sta vive al di fuori del modello) e Comando VI (L'influenza non è affidabilitàM SK1

DPD Chatbot

La chatbot di servizio al cliente dell'azienda DPD' è stata distrutta da un utilizzatore frustrato. giurare ,, criticare la compagnia , e scrivere poesie. su quanto il DPD fosse inutile.

La lezione di ingegneria del software: Le guardie non sono opţionali. Ma soprattutto - se il vostro chatbot può essere ingannato per insultare la vostra aziendaM SK2 voi ' l'avete dato troppo larghe Comando VIII: demolire il LLM ad essere un consulente. dovrebbe recuperare e sintetizzareM SK2 non freestyle .

Chevrolet Dealership ChatGPT

Un distributore Chevrolet ha integrato ChatGPT nel suo sito web. Gli utenti l'hanno immediatamente ricevuto. agreed to sell them a 2024 Chevy Tahoe for $1, scrivere il codice Python, e raccomandare i veicoli Ford inveceM SK2

La lezione di ingegneria del software: Non si può attaccare un LLM di scopo generale a un sistema di transazione e aspettarsi che faccia rispettare le regole commerciali. Comandamento III: la causalità appartiene al codice

Database di produzione di agents Wipes ripetiti

In luglio 2025, Replit's AI coding assistant went rogue all'inizio SaaStr. Malgrado le istruzioni esplicite di non modificare il codice di produzione durante un congelamento del codice, l'agente ha cancellato la base di dati della produzioneM SK2 PeggioMSC3 allora Oscurato i danni causati dalla creazione di 4,000 utenti falsi , rapporti di fabbricazione, e bugie sui risultati dei test delle unitàM SK3

Amjad Masad, l'amministratore delegato, ha risposto che era inaccettabile e non avrebbe mai dovuto essere possibile.

La lezione di ingegneria del software: Questo non riguarda la malizia - questo ' l'autorità senza confini . Un agente AI con accesso a writing alla produzione e nessun sistema di guardia rigido farebbe qualcosa di catastrofico \ . La soluzione non è ' non è meglio dare un suggerimento \ Comando II e Comando IX: gli effetti collaterali hanno bisogno di sistemi deterministici , e la macchina da borsaggio è la prima

NYC MyCity Chatbot consiglia di infrangere la legge

New York City's Microsoft-powered Il chatbot MyCity ha detto ai proprietari di un'azienda Potrebbero legalmente tagliare i lavoratori' consigli, gli impiegati del fuoco che si lamentano di disturbi sessualiM SK2 e servire cibo spazzato da roditoriMSC3 Tutto illegale secondo la legge di New York .

Il chatbot rimane online. Il sindaco Adams lo ha difeso.

La lezione di ingegneria del software: La guida legale e politica non è un compito di riassunto - è una ricerca con stringente prescrizioni di correttezzaM SK2 Il LLM non avrebbe mai dovuto generare consigli legali; dovrebbe averli recuperati da una fonte verificata . Comandamento I: lo stato ( e la politicaM SK2 vive fuori dal modello.

iTutor Group's AI rifiuta i candidati secondo l'età

In 2023, tutoring company iTutor Group Ha pagato $365,000 per risolvere una causa dell'EEOC. dopo che il suo software di reclutamento AI ha automaticamente respinto le candidate femminili di età 55+ e i candidati maschili di edad 60+. E dopo che gli candidati qualificati di 200 sono stati eliminati.

"Even quando la tecnologia automatizza la discriminazione, l'employeur è ancora responsabile", ha detto Charlotte Burrows, presidente del COSE.

La lezione di ingegneria del software: Pregiudizi in, pregiudizio fuoriM SK1 Se i dati della vostra formazione codificano la discriminazione, il vostro modello discriminarà - con certezza e su larga scalaMSC4 Questo è Comando IV applicata all'assunto: la classificazione è accettabile per gli LLM, ma solo quando voiM SK2 avete validato ciò che il ' sta realmente classificando sulla . l'età non eraMSC5 non una caratteristica validaMST6 Il sistema aveva bisogno di un'analisi umanaMSL7 non dell'automazioneMSV8

Chicago Sun-Times pubblica una lista di libri allucinati

Nel maggio 2025, il Chicago Sun-Times ha pubblicato una lista di lettura d'estate. I veri autori hanno attribuito titoli falsi che sembravano plausibili ma erano completamente alucinati.

La lezione di ingegneria del software: I LLM non sono database. Generano un testo statisticamente plausibileM SK1 Se avete bisogno di fatti, cercate una fonte di veritàMSC3 Comando VI: La flessibilità non è affidabilità


Perché è importante?

Nessuna di queste aziende è incompetente. supponendo che dato che i LLM possono produrre una lingua coerente, possono essere affidati a produrre un comportamento corretto.

I rivenditori vendono "agenti AI" come un modo per saltare via il lavoro noioso - le urne, , le macchine di stato,, la validazione,M SK5 e l'auditazione,. Ma quel lavoro noio è ciò che rende affidabile il software.

Come CIO's Thor Olavsrud notaIl capire i vostri dati e quello che vi dicono è importante, ma è altrettanto importante comprendere gli strumenti che usate, conoscere i dati, mantenere fermamente in mente i valori dell'organizzazione.

Ogni singolo fallimento precedente sarebbe stato evitato dalla disciplina di ingegneria software di base.

Notate che nessuna di queste soluzioni implica modelli migliori:

Esplosione Avrebbe potuto essere evitata da
I sondaggi di Vivint non ricevono Evento- Triggere guidato sul caso chiuso
McDonald's false orders Structured order form + speechM SK4to-intent
La falsa politica di Air Canada Ricerca della politica da una fonte affidabile
Profanità della DPD Template di risposta, non generazione
Chevy $1 auto Non c'è LLM nel percorso di transazione S
Lavorare la base di dati ripetitiva Isolazione ambientale, limiti di permesso
Consulenze giuridiche NYC Relezione da documenti di politica verificati PSK2
Discriminazione dell'età del tutor Validazione delle caratteristiche, revisione umana
Lista di libri falsi Query actual book database

L'ironia è forte. dopo. Il LLM fallì - che è solo ingegneria software con ulteriori passi e una crisi di PR .


Che aspetto ha il diritto?

La Sala della Vergogna mostra cosa succede quando si ignorano questi principi. Ma non sono solo restrizioni teoriche. Sono le fondamenta dei sistemi che funzionano.

Questo non è ipotetico. Questi principi funzionano già nella produzione, tra cui i sistemi che ho costruito.

DiSE: Evolution controllata con dei non credibili

L'informazione figura nella parte dispositiva. L'architettura di DiSE tratta i LLM esattamente come dovrebbero essere trattati: come consulenti incredibili. operando in una gabbia deterministica.

  • Perché la struttura batte la fragilità - L'LLM propone ; la macchina dello stato lo smalti. Ogni azione passa attraverso la validazioneM SK3 ogni transizione è registrataMSC4 ogni fallimento è recuperabileMST5
  • Trattare i LLM come inaffidabili - Il modello "God tierM SK2 è potente ma esplicitamente distruito. Può suggerireMSC4 ma non può commettere
  • La rampa dell'ascensore - Flussi di lavoro verificabili dove il LLM è materiale da costruzioneM SK1 non architetto.

Il punto di vista chiave: I LLM sono eccezionali nel generare ipotesi. I sistemi deterministici sono eccellenti nel validarli. DiSE usa entrambi.

Detezione del bot: LLM come consulente, Non controllatore

L'informazione figura nella parte dispositiva. motore di rilevamento dei robot Demonstra. Comando VIII in pratica:

  • Il LLM analizza i modelli comportamentali e suggerisce le classificazioni.
  • Ma Decisione di rilevamento proviene da un sistema di classificazione con limiti esplicitati.
  • Lo stato vive nella base di dati, non nella finestra del contesto
  • Ogni decisione è controllabile e riproducibile.

Questo è il modello : usare l'elettricità del LLM ' la forza del ( il riconoscimento dello schema le generazioni di ipotesi l'emergenza dell'ipotesia L'eletricità della meccanica lo stato gli stati i passaggi Gli effetti collaterali I passaggi 8 in codice deterministico

Fuzzine limitate: Il modello del sistema di controllo

L'informazione figura nella parte dispositiva. Patterno di Fuzzine Constretto forma la relazione tra componenti probabilistici e deterministici:

  • Il substrato (facts) alimenta la Propositore (LLM), che alimenta il Construitore (validateM SK1 rewrite, budget )
  • Il LLM non possiede mai uno stato o effetti collaterali.
  • Ogni output è limitato da restrizioni dure.

Parte 2: The Constrained Fuzzy MoM si estende a sistemi multi-agenti dove molti LLM comunicano attraverso segnali tipificatiM SK1 non linguaggio naturale. Il substrato diventa condiviso . Il constrainer diventa un coordinatoreMSC4 I comandi continuano ad essere applicati

Zero-PII Intelligenza dei clienti

Capizione semantica senza memorizzare identità mostra come usare embeddings e LLM per l'intuizione del cliente, mantenendo le parti pericolose (PII, PreferenzeM SK2 Comportamento ) in sistemi strutturatiMST4 controllabiliMSST5

La memoria comportamentale LRU

Imparare LRU - Anche la gestione della memoria segue questi principi. Il LLM potrebbe aiutare a decidere. Che cosa? per ricordare, ma il Mecanismi Il ricordo è noioso.


Regola finale (quello che contaM SK1

I LLM interpretano la realtà. Non devono mai essere autorizzati a definirla.

Usate ogni strumento per capire cosa sia di buono a ..

Abbiamo già risolto lo stato, la causalità, e le garanzieM SK2 Non smettete di imparare questo solo perché la demo sembra intelligente.

E quando si ottiene questo bene, succede qualcosa di sorprendenteM SK1 smettete di avere bisogno dei modelli costosi. Un modello di parametri 7B che funziona localmente può classificareMSC4 riassumere~, e generare delle ipotesi semplicemente bene. Perché i sistemi deterministici intorno a esso gestiscono tutto ciò che deve essere corretto. I modelli frontiere vi stanno vendendo la affidabilità che dovreste costruire da soli.

Costruire la macchina noiosa. Demolare il LLM al consulente. E poi osservare un piccolo modello che colpisce molto sopra il suo pesoM SK2

Se questo sembra ovvio, buonoM SK1 Significa che già sapete come costruire sistemi affidabili. Il problema è fare finta che queste regole non si applichino piùMSC3

logo

© 2026 Scott Galloway — Unlicense — All content and source code on this site is free to use, copy, modify, and sell.