Back to "Perché i LLM falliscono come sensori (e quali cervelli vanno bene)"

This is a viewer only at the moment see the article on how this works.

To update the preview hit Ctrl-Alt-R (or ⌘-Alt-R on Mac) or Enter to refresh. The Save icon lets you save the markdown file to disk

This is a preview from the server running through my markdig pipeline

AI Architecture Audio LLM OCR Patterns Video

Perché i LLM falliscono come sensori (e quali cervelli vanno bene)

Sunday, 18 January 2026

I LLM (Modelli linguistici enormi) vengono usati come sensori . Questo è un errore nella categoria: usando un sintetizzatore probabilistico dove è necessario un dispositivo di confine deterministico.

Questo non è't gli sviluppatoriM SK1 errore. La maggior parte degli esempi e dei tutorial di base portano con la dimostrazione più semplice : MSC4 basta mandarlo al modelloMST5 Ciò rende l'atterraggio facileMSSK6 ma sbuccia un limite cruciale MST7 percezione contro sintesiMTS8 Gli incentivi dell'industria non aiutanoMSS9 né l'altro MSS10 tokenM SS11 i sistemi a prezzi premiano naturalmente le pipelines che fanno più lavoro all'interno del LLMMISS12

Questo articolo parla di RAG ridotto - un modello architettonico dove Le tubature deterministiche alimentano i componenti probabilistici., non l'altro latoM SK1 In un sistema RAG corretto:

  • Pipeline (sensori → modelli locali → fatti strutturati) fanno la riduzione
  • LLM Operare solo su un output strutturato ridotto,.
  • Mai. spedire dati brutti direttamente ai LLM.

Esempio: Nell'OCR (Recognizione dei caratteri otticiM SK2 tubo di tubatura , il Vision LLM è di livello 3, non di livello La regola dei confini. - una restrizione architettonica che impedisce l'uso inappropriato di strumenti a prescindere dalla loro convenienza.


Parte 1: Il problema (Perché i LLM falliscono come sensori)

Lo stesso errore, Modalità diverse

Qui ci sono errori architettonici identici in diversi settori:

  • OCR (Recognizione di caratteri ottici): Inviare frammenti di video crudi direttamente ai LLM della Vision invece dell'uso del testo-heuristica di similitude e modelli locali di OCR
  • L'analisi delle immagini: Chiedere ai LLM di "descrivere quest'immagine" invece di estrarre i segnali strutturati prima SSK3oggettiM SK4 voltiMSC5 regioni di testoMNK6
  • Traduzione video: Running LLMs frame-byM SK2frame instead of detecting shotsMSC3 extracting keyframes , and deduplicating visual content
  • L'analisi audio: Chiedere ai LLM di dedurre l'identità o la qualità dell'audio del suonatore da forme d'onda scarse invece di usare il processo di segnale.
flowchart TD
    subgraph Wrong["❌ Common Anti-Pattern"]
        Raw[Raw Data<br/>Pixels, Waveforms, Frames] -->|Direct feed| LLM1[Vision/Audio LLM<br/>$$$, variance, hallucination]
        LLM1 --> Unreliable[Unreliable Output<br/>High cost, non-deterministic]
    end

    style Wrong fill:none,stroke:#dc2626,stroke-width:3px
    style Raw fill:none,stroke:#6b7280,stroke-width:2px
    style LLM1 fill:none,stroke:#dc2626,stroke-width:2px
    style Unreliable fill:none,stroke:#dc2626,stroke-width:2px

I sintomi

Questi errori architettonici producono fallimenti prevedibili:

  1. Percezione allucinata: LLMs deve Esizione di monete. Nell'incertezza riempiono i buchi con completioni plausibili. M SK2Texto rilevato " perché potrebbe esserciMNK4 non perché ci siaMMK5 Questo è il problema principale.

  2. Non errore determinante-: Variazione nella temperatura e nella spinta del budget dei toniM SK1 Stesso input → diversi output. Il debugging diventa un'analisi statisticaMSC4

  3. Risorse di scarto: Che si paghi per un tocco (API) o si gestiscono modelli locali |( |Ollama | , | llama | . | cpp | МSK7 | tu |' | stai bruciando la computazione sulla missione sbagliata |M. | I LLM locali non costano |' | il costo di una chiamata M, | ma producono comunque un risultato sensoriale inaffidabile |m.

La questione è:', "t costo, -", "it", ', "l'accuratezza", .. Un LLM localmente ospitato che ha l'allucinazione dei risultati OCR è rotto come un expensive call API che fa la stessa cosa. Sensori deterministici producono fatti verificabiliM SK1 I LLM producono prose plausibili.

Perché questo accade: Sensori vs. Synthesizer

L'errore della categoria esiste perché. Un sensore e un sintetizzatore sono strumenti fondamentalmente diversi:

Un sensore è un dispositivo di confine:

  • Riduce la dimensione del mondo' M SK1photoni → segnali strutturati)
  • Presenta fatti con punteggi di fiducia.
  • Ha conosciuto i modi di fallimento caratterizzati da,
  • Economico, veloce, ripetibileM SK2 deterministico

Un LLM è un sintetizzatore di variazioni alto.

  • Aumenta i gradi di libertà ( fatti → testi , strutturati → non strutturati
  • Nessun concetto stabile di " nulla rilevatoM SK1 (producerà sempre dei tokens)
  • Il risultato varia con il contesto, prompt, temperatura
  • Scalare linearmente i costi con la dimensione dell'input.
  • Non-determinista dal design
flowchart LR
    subgraph Sensor["Sensor (Boundary Device)"]
        World[Physical World<br/>∞ dimensions] -->|Reduce| Signal[Structured Signal<br/>Bounded dimensions]
        Signal -->|Confidence| Facts[Facts<br/>± certainty]
    end

    subgraph LLM["LLM (Synthesizer)"]
        Input[Structured Input] -->|Synthesize| Prose[Unstructured Output<br/>High entropy]
        Prose -->|No confidence| Tokens[Token stream<br/>No 'nothing' state]
    end

    style Sensor fill:none,stroke:#16a34a,stroke-width:2px
    style LLM fill:none,stroke:#b45309,stroke-width:2px
    style World fill:none,stroke:#6b7280,stroke-width:2px
    style Signal fill:none,stroke:#2563eb,stroke-width:2px
    style Facts fill:none,stroke:#059669,stroke-width:2px
    style Input fill:none,stroke:#6b7280,stroke-width:2px
    style Prose fill:none,stroke:#d97706,stroke-width:2px
    style Tokens fill:none,stroke:#dc2626,stroke-width:2px

Ecco perché. StyloFlow Tratta i segnali come fatti immutabili, non prose. I modelli possono proporreM SK2 La politica determinista decide cosa persista .


Parte 2: Il principio (Sensori primaM SK2 Sintesi ultima)

Che cervelli vanno bene (No Romance)

I cervelli non iniziano con il ragionamento. Cominciano con Constraintazione.

La retina non è la corteccia. C'è un pesante preprocesso prima che qualcosa assomiglia alla cognizione:

  • Detezione del bordo (onM SK1centrale, fuori -cellule del ganglione centraleMSC4
  • Detezione del movimento (selettività indirizzata in VM SK1
  • Sopressione del contrasto (inhibizione laterale)
  • Riscaldamento del rumore (

Quando i limiti sensoriali si debilitano, le allucinazioni aumentano. Bassa luce, bordi scomparsiM SK1 segnali ambigui . Non è una metafora - è lo stesso modo di fallimento delle allucinazioni LLM sotto l'incertezzaMSC4 Gli ingegneri lo sanno già.

Pipeline percettive tra le specie

Questo problema-lo schema di risoluzione si presenta in tutti i sistemi di percezione animale,non solo nella visione umanaM SK2

L'ecolocalizzazione dei pipistrelli (auditorio):

  • Il problema.: Le riflessioni ultrasuonifere crude contengono milioni di punti dati al secondo.
  • Soluzione: Filtri specializzati per il processo cocleare per spostamento di Doppler, ritardi temporaliM SK2 amplitude
  • Risultato: Signali strutturati (distanza, velocitàM SK3 consistenzaMSC4 prima del processo cortile.
  • Paralelità di ingegneria: Trattamento di segnali audio → caratteristiche PSK2 diarizzazione CMS3 sintesi LLM

La visione delle api mellifere (detezione di movimentoM SK1

  • Il problema.: Il campo visivo cambia rapidamente durante il volo
  • Soluzione: Calcolo del flusso ottico nella lamina (prima strata neurale), non nel cervello centrale
  • Risultato: La evitazione di collisioni funziona su vettori di movimento, non pixel crudi
  • Paralelità di ingegneria: Detezione del movimento dell'openCV → tracciamento → analisi semantica
flowchart LR
    subgraph Bat["Bat Echolocation"]
        Echo[Ultrasonic Echo<br/>∞ waveform data] --> Cochlea[Cochlear Filters<br/>Doppler, delay, amplitude]
        Cochlea --> BatBrain[Auditory Cortex<br/>Distance, texture facts]
    end

    subgraph Bee["Honeybee Vision"]
        Motion[Visual Field<br/>Rapid motion] --> Lamina[Lamina<br/>Optical flow computation]
        Lamina --> BeeBrain[Central Brain<br/>Motion vectors, not pixels]
    end

    style Bat fill:none,stroke:#7c3aed,stroke-width:2px
    style Bee fill:none,stroke:#d97706,stroke-width:2px
    style Echo fill:none,stroke:#6b7280,stroke-width:2px
    style Cochlea fill:none,stroke:#a855f7,stroke-width:2px
    style BatBrain fill:none,stroke:#6366f1,stroke-width:2px
    style Motion fill:none,stroke:#6b7280,stroke-width:2px
    style Lamina fill:none,stroke:#f59e0b,stroke-width:2px
    style BeeBrain fill:none,stroke:#d97706,stroke-width:2px

Il modello comune:

  1. Donni sensoriali crudi (problemaM SK1 troppo , troppo rumoroso, troppo altoMSC4dimensionaleMST5
  2. Preprocesso dei confini (soluzioneM SK1hardware specializzato /wetware riduce,filtriMNK4 struttureMRK5
  3. Trattamento cognitivo (opera su fatti, non segnali grezziM SK2

Questo non è "inspirazione dalla natura." È l'evoluzione convergente del processo di informazione sotto restrizioni fisiche | ( | energia |, | latenza | МSK4 | larghezza di banda | ). | Le stesse restrizioni si applicano ai sistemi AI |

La mappatura ingegneristica è stretta:

flowchart TD
    subgraph Brain["Biological Vision Pipeline"]
        Photons[Photons] --> Retina[Retina<br/>Edge detection, contrast]
        Retina --> V1[V1 Cortex<br/>Orientation, motion]
        V1 --> IT[Inferotemporal Cortex<br/>Object recognition]
        IT --> PFC[Prefrontal Cortex<br/>Reasoning, synthesis]
    end

    subgraph Engineering["Engineering Vision Pipeline"]
        Pixels[Raw Pixels] --> OpenCV[OpenCV + Heuristics<br/>Sharpness, text-likeliness]
        OpenCV --> Local[Local Models<br/>Florence-2, EAST/CRAFT OCR]
        Local --> Structured[Structured Signals<br/>Bounding boxes, confidence]
        Structured --> LLM[LLM Synthesis<br/>Only when needed]
    end

    Brain -.->|Maps to| Engineering

    style Brain fill:none,stroke:#7c3aed,stroke-width:2px
    style Engineering fill:none,stroke:#2563eb,stroke-width:2px
    style Photons fill:none,stroke:#6b7280,stroke-width:2px
    style Retina fill:none,stroke:#16a34a,stroke-width:2px
    style V1 fill:none,stroke:#059669,stroke-width:2px
    style IT fill:none,stroke:#0891b2,stroke-width:2px
    style PFC fill:none,stroke:#6366f1,stroke-width:2px
    style Pixels fill:none,stroke:#6b7280,stroke-width:2px
    style OpenCV fill:none,stroke:#16a34a,stroke-width:2px
    style Local fill:none,stroke:#059669,stroke-width:2px
    style Structured fill:none,stroke:#0891b2,stroke-width:2px
    style LLM fill:none,stroke:#6366f1,stroke-width:2px

I cervelli non comprendono i pixel.

La corteccia opera su segnali che sono stati ridotti, filtrati, e strutturati da strati precedentiM SK2 Non è una limitazione MSC3 è ciò che rende l'intelligenza facile da manipolare .

Consequenze ingegneristiche (Regole di progettazione)

Questo non è un punto di vista filosofico. È il design del sistema:

  1. L'escalazione deve essere fermata.: I LLM sono di livello 3, non di livello

  2. I limiti di sicurezza devono essere espliciti.: "Texto rilevato con 0.92 fiduciaM SK3 è un fatto. "Potrebbe esserci un testoMST6 non èMSST7

  3. Il percorso deve essere deterministico.: I segnali stessi → lo stesso percorsoM SK2 Nessuna variazione di impulso, nessun effetto termicoMSC4

  4. L'economia dei simboli è una limitazione, non un cambiamento di costi.: Se il tuo tubo di costruzione'ha una scala dei costi con la dimensione delle informazioni brutteM SK2 state usando l'outil sbagliato .

  5. I fatti hanno bisogno di prove.: Se si può ' non puntare alla scatola di piegatura, a un'immagineM SK3 o a una regione di forma d'ondaMSC4 non è ' non si tratta di un fatto

Proof: L'ottimizzazione delle piste da filmare

Nell'università. VideoSummarizer, testoM SK1 solo i filmtrip riducono il costo del token di ~30x mentre Improvvisare. La fidelità dell'OCR. Il LLM vede il segnale (Regioni di testo extraiteM SK2 non la scena (frame RGB completiMSC4

Non è un'ottimizzazione. È una correzione di categoria.


Parte 3: Il modello nella pratica

Il modello generale: Reduced RAG è Map-Reduce per sistemi probabilistici.

Questo è il RAG ridotto modello architettonico. Il principio principale: I canali alimentano i componenti probabilistici..

RAG ridotta è Map-Reduczione applicata ai sistemi probabilistici:

  • La fase della mappa (deterministaM SK1parallela,distribuita ): I sensori e i modelli locali estraggono fatti strutturati dai dati scarsi.
  • La fase di riduzione (probabilistaM SK1sequenziale,centralizzata ): LLM sintetizza sui fatti estrattos.

La RAG tradizionale arriva indietro - recupera i documenti e spera che il LLM estragga i fatti. RAG ridotta Preleva i fatti prima. (mapM SK1 poi permette al LLM di sintetizzare (reduce).

Il modello si ripeteva in tutti i sistemi multimodali:

  1. Mappa: Sensori riducono (filtro e struttura determinista dell'euristica dati scarsi - paralleli tra i frammentiM SK2chunks)
  2. Mappa: Estratto dei modelli locali (modelli specializzati producono dati con punteggi di fiducia - paralleli per unità di dati
  3. Mappa: Route della politica (limiti deterministici determinanoM SK1 persistere o escalare - parallelo per fatto)
  4. Reduce: LLMs synthesize (operare solo su fatti raccoltiM SK1 mai dati scarsi - sintesi sequenziale)
flowchart TD
    subgraph Map["MAP PHASE (Parallel, Deterministic)"]
        Raw[Raw Data<br/>10,000 frames] --> Split{Split}

        Split --> S1[Sensors<br/>Frame 1-1000]
        Split --> S2[Sensors<br/>Frame 1001-2000]
        Split --> S3[Sensors<br/>Frame 2001-3000]
        Split --> SDots[...]

        S1 --> L1[Local Models<br/>Batch 1]
        S2 --> L2[Local Models<br/>Batch 2]
        S3 --> L3[Local Models<br/>Batch 3]
        SDots --> LDots[...]

        L1 --> F1[Facts: 120]
        L2 --> F2[Facts: 98]
        L3 --> F3[Facts: 156]
        LDots --> FDots[...]

        F1 --> Collect[Collect Facts]
        F2 --> Collect
        F3 --> Collect
        FDots --> Collect

        Collect --> Facts[(Facts Database<br/>500 total facts)]
    end

    subgraph Reduce["REDUCE PHASE (Sequential, Probabilistic)"]
        Query[User Query] --> Retrieve[Retrieve Relevant Facts<br/>Filter: 50 facts]
        Facts --> Retrieve
        Retrieve --> LLM[LLM Synthesis<br/>Reason over 50 facts]
        LLM --> Answer[Grounded Answer]
    end

    style Map fill:none,stroke:#16a34a,stroke-width:3px
    style Reduce fill:none,stroke:#6366f1,stroke-width:3px
    style Raw fill:none,stroke:#6b7280,stroke-width:2px
    style Split fill:none,stroke:#16a34a,stroke-width:2px
    style S1 fill:none,stroke:#16a34a,stroke-width:2px
    style S2 fill:none,stroke:#16a34a,stroke-width:2px
    style S3 fill:none,stroke:#16a34a,stroke-width:2px
    style SDots fill:none,stroke:#16a34a,stroke-width:1px,stroke-dasharray: 5 5
    style L1 fill:none,stroke:#059669,stroke-width:2px
    style L2 fill:none,stroke:#059669,stroke-width:2px
    style L3 fill:none,stroke:#059669,stroke-width:2px
    style LDots fill:none,stroke:#059669,stroke-width:1px,stroke-dasharray: 5 5
    style F1 fill:none,stroke:#0891b2,stroke-width:2px
    style F2 fill:none,stroke:#0891b2,stroke-width:2px
    style F3 fill:none,stroke:#0891b2,stroke-width:2px
    style FDots fill:none,stroke:#0891b2,stroke-width:1px,stroke-dasharray: 5 5
    style Collect fill:none,stroke:#16a34a,stroke-width:2px
    style Facts fill:none,stroke:#0891b2,stroke-width:3px
    style Query fill:none,stroke:#6b7280,stroke-width:2px
    style Retrieve fill:none,stroke:#7c3aed,stroke-width:2px
    style LLM fill:none,stroke:#6366f1,stroke-width:2px
    style Answer fill:none,stroke:#16a34a,stroke-width:2px

Documento-prima RAG vs.Rag ridottaM SK2

Aspetto Documento-Prima RAG RAG ridotta SCartaM SK5ReducereMST6 SST7
Il modello Relevare → Estratto → Sintese S Mappa M( Estraggere R) D→ Ridurre P(Sintesa L) |
Accuratezza dell'estrazione Possibili allucinazioni di LLM Deterministice, verificabile
Donni conservati Documenti
Il ruolo di LLM Due compiti: estratto + sintetizzare Un compitoM SK4 sintetizzare solo S
Debuggeribilità esaminare le tracce del prompt esaminare la base di dati dei fatti
La scalabilità Bottleneck sequenziale del LLM Mappa distribuita, Reduzione centralizzata MSC3

Implementazioni concrete

Tre sistemi di produzione implementano questo schema:

  • ImageSummarizer: Heuristica → Florence-2 OCR → Vision LLM SSK4Escalazione soloM SK5
  • AudioSummarizer: Attribuzioni acustiche → Diarizzazione → LLM ( solo tempo di richiestaMSC4
  • VideoSummarizer: Detezione di sparatorie → Keyframes CSK2 CLIP embeddings

Perché funziona?

Ecco i numeri reali di VideoSummarizer su un video di 10-minuta (600 secondiM SK2 | | 30fps

Approco Accuratezza Determinismo S Tocche M
Frame-by-frame LLM AllucinazioniM SK1 variazione Non--determinista S~27M SSK6
Shots → Keyframes → LLM Accurato Extrazione deterministica SSK2 ~150K S
Extrazione del testo della filmstrappa La migliore fideltà dell'OCR Decisivamente determinista SSK2 ~5K S

L'architettura giusta è più precisa. Succede anche che sia più economico 180x ma questo ' è un effetto collaterale di fare la cosa giusta МSK3 non l'obiettivo


Conclusione

Se il vostro sistema AI inizia con un LLM, ne avete già perso il controllo.

L'intelligenza non inizia con il ragionamento. Inizia con la constrazione.

I sensori riducono l'incertezza. I sintetizzatori espandono il significatoM SK1 Confondere i due sistemi di rotture.

Rendere la sintesi l'ultimo passo.


Esempi chiave

  • RAG ridotto: MappaM SK1Reduczione per sistemi probabilistici. Mappe (estrazione deterministicaMSC4
  • Errore nella categoria: Trattare qualcosa come appartenenza a un tipo fondamentalemente diverso da quello che è.
  • Disposivo di confine: Riduce i dati scarsi da grandi dimensioni a dati strutturati da piccoli dimensioni con una precisione nota.
  • Niveau di escalazione: Fallback a LLM solo quando i metodi deterministici falliscono.
  • Diarizzazione: Separazione del suonatore nell'audio ( chi ha parlato quando)

Article connessi

logo

© 2026 Scott Galloway — Unlicense — All content and source code on this site is free to use, copy, modify, and sell.