# Perché i LLM falliscono come sensori (e quali cervelli vanno bene)

<!-- category -- AI,Architecture,LLM,OCR,Audio,Video,Patterns -->
<datetime class="hidden">2026-01-18T15:33</datetime>

I LLM (Modelli linguistici enormi) vengono usati come sensori . Questo è un **errore nella categoria**: usando un sintetizzatore probabilistico dove è necessario un dispositivo di confine deterministico.

Questo non è't gli sviluppatoriM SK1 errore. La maggior parte degli esempi e dei tutorial di base portano con la dimostrazione più semplice : MSC4 basta mandarlo al modelloMST5 Ciò rende l'atterraggio facileMSSK6 ma sbuccia un limite cruciale MST7 percezione contro sintesiMTS8 Gli incentivi dell'industria non aiutanoMSS9 né l'altro MSS10 tokenM SS11 i sistemi a prezzi premiano naturalmente le pipelines che fanno più lavoro all'interno del LLMMISS12

Questo articolo parla di **[RAG ridotto](/blog/reduced-rag)** - un modello architettonico dove **Le tubature deterministiche alimentano i componenti probabilistici.**, non l'altro latoM SK1 In un sistema RAG corretto:

- **Pipeline** (sensori → modelli locali → fatti strutturati) fanno la riduzione
- **LLM** Operare solo su un output strutturato ridotto,.
- **Mai.** spedire dati brutti direttamente ai LLM.

Esempio: Nell'OCR (Recognizione dei caratteri otticiM SK2 tubo di tubatura , il Vision LLM è di livello 3, non di livello **La regola dei confini.** - una restrizione architettonica che impedisce l'uso inappropriato di strumenti a prescindere dalla loro convenienza.

[TOC]

---


## Parte 1: Il problema (Perché i LLM falliscono come sensori)

### Lo stesso errore, Modalità diverse

Qui ci sono errori architettonici identici in diversi settori:

- **OCR (Recognizione di caratteri ottici)**: Inviare frammenti di video crudi direttamente ai LLM della Vision invece dell'uso del testo-heuristica di similitude e modelli locali di OCR
- **L'analisi delle immagini**: Chiedere ai LLM di "descrivere quest'immagine" invece di estrarre i segnali strutturati prima SSK3oggettiM SK4 voltiMSC5 regioni di testoMNK6
- **Traduzione video**: Running LLMs frame-byM SK2frame instead of detecting shotsMSC3 extracting keyframes , and deduplicating visual content
- **L'analisi audio**: Chiedere ai LLM di dedurre l'identità o la qualità dell'audio del suonatore da forme d'onda scarse invece di usare il processo di segnale.

```mermaid
flowchart TD
    subgraph Wrong["❌ Common Anti-Pattern"]
        Raw[Raw Data<br/>Pixels, Waveforms, Frames] -->|Direct feed| LLM1[Vision/Audio LLM<br/>$$$, variance, hallucination]
        LLM1 --> Unreliable[Unreliable Output<br/>High cost, non-deterministic]
    end

    style Wrong fill:none,stroke:#dc2626,stroke-width:3px
    style Raw fill:none,stroke:#6b7280,stroke-width:2px
    style LLM1 fill:none,stroke:#dc2626,stroke-width:2px
    style Unreliable fill:none,stroke:#dc2626,stroke-width:2px
```

### I sintomi

Questi errori architettonici producono fallimenti prevedibili:

1. **Percezione allucinata**: LLMs *deve* Esizione di monete. Nell'incertezza riempiono i buchi con completioni plausibili. M SK2Texto rilevato " perché potrebbe esserciMNK4 non perché ci siaMMK5 **Questo è il problema principale.**

2. **Non errore determinante-**: Variazione nella temperatura e nella spinta del budget dei toniM SK1 Stesso input → diversi output. Il debugging diventa un'analisi statisticaMSC4

3. **Risorse di scarto**: Che si paghi per un tocco (API) o si gestiscono modelli locali |( |Ollama | , | llama | . | cpp | МSK7 | tu |' | stai bruciando la computazione sulla missione sbagliata |M. | I LLM locali non costano |' | il costo di una chiamata M, | ma producono comunque un risultato sensoriale inaffidabile |m.

**La questione è:', "t costo, -", "it", ', "l'accuratezza", ..** Un LLM localmente ospitato che ha l'allucinazione dei risultati OCR è rotto come un expensive call API che fa la stessa cosa. Sensori deterministici producono fatti verificabiliM SK1 I LLM producono prose plausibili.

### Perché questo accade: Sensori vs. Synthesizer

L'errore della categoria esiste perché. **Un sensore e un sintetizzatore sono strumenti fondamentalmente diversi:**

**Un sensore è un dispositivo di confine:**

- Riduce la dimensione del mondo' M SK1photoni → segnali strutturati)
- Presenta fatti con punteggi di fiducia.
- Ha conosciuto i modi di fallimento caratterizzati da,
- Economico, veloce, ripetibileM SK2 deterministico

**Un LLM è un sintetizzatore di variazioni alto.**

- Aumenta i gradi di libertà ( fatti → testi , strutturati → non strutturati
- Nessun concetto stabile di " nulla rilevatoM SK1 (producerà sempre dei tokens)
- Il risultato varia con il contesto, prompt, temperatura
- Scalare linearmente i costi con la dimensione dell'input.
- Non-determinista dal design

```mermaid
flowchart LR
    subgraph Sensor["Sensor (Boundary Device)"]
        World[Physical World<br/>∞ dimensions] -->|Reduce| Signal[Structured Signal<br/>Bounded dimensions]
        Signal -->|Confidence| Facts[Facts<br/>± certainty]
    end

    subgraph LLM["LLM (Synthesizer)"]
        Input[Structured Input] -->|Synthesize| Prose[Unstructured Output<br/>High entropy]
        Prose -->|No confidence| Tokens[Token stream<br/>No 'nothing' state]
    end

    style Sensor fill:none,stroke:#16a34a,stroke-width:2px
    style LLM fill:none,stroke:#b45309,stroke-width:2px
    style World fill:none,stroke:#6b7280,stroke-width:2px
    style Signal fill:none,stroke:#2563eb,stroke-width:2px
    style Facts fill:none,stroke:#059669,stroke-width:2px
    style Input fill:none,stroke:#6b7280,stroke-width:2px
    style Prose fill:none,stroke:#d97706,stroke-width:2px
    style Tokens fill:none,stroke:#dc2626,stroke-width:2px
```

Ecco perché. [StyloFlow](/blog/styloflow-signal-driven-workflows) Tratta i segnali come fatti immutabili, non prose. I modelli possono proporreM SK2 La politica determinista decide cosa persista .

---


## Parte 2: Il principio (Sensori primaM SK2 Sintesi ultima)

### Che cervelli vanno bene (No Romance)

I cervelli non iniziano con il ragionamento. Cominciano con **Constraintazione**.

La retina non è la corteccia. C'è un pesante preprocesso prima che qualcosa assomiglia alla cognizione:

- **Detezione del bordo** (onM SK1centrale, fuori -cellule del ganglione centraleMSC4
- **Detezione del movimento** (selettività indirizzata in VM SK1
- **Sopressione del contrasto** (inhibizione laterale)
- **Riscaldamento del rumore** (

**Quando i limiti sensoriali si debilitano, le allucinazioni aumentano.** Bassa luce, bordi scomparsiM SK1 segnali ambigui . Non è una metafora - è lo stesso modo di fallimento delle allucinazioni LLM sotto l'incertezzaMSC4 Gli ingegneri lo sanno già.

### Pipeline percettive tra le specie

Questo problema-lo schema di risoluzione si presenta in tutti i sistemi di percezione animale,non solo nella visione umanaM SK2

**L'ecolocalizzazione dei pipistrelli** (auditorio):

- **Il problema.**: Le riflessioni ultrasuonifere crude contengono milioni di punti dati al secondo.
- **Soluzione**: Filtri specializzati per il processo cocleare per spostamento di Doppler, ritardi temporaliM SK2 amplitude
- **Risultato**: Signali strutturati (distanza, velocitàM SK3 consistenzaMSC4 prima del processo cortile.
- **Paralelità di ingegneria**: Trattamento di segnali audio → caratteristiche PSK2 diarizzazione CMS3 sintesi LLM

**La visione delle api mellifere** (detezione di movimentoM SK1

- **Il problema.**: Il campo visivo cambia rapidamente durante il volo
- **Soluzione**: Calcolo del flusso ottico nella lamina (prima strata neurale), non nel cervello centrale
- **Risultato**: La evitazione di collisioni funziona su vettori di movimento, non pixel crudi
- **Paralelità di ingegneria**: Detezione del movimento dell'openCV → tracciamento → analisi semantica

```mermaid
flowchart LR
    subgraph Bat["Bat Echolocation"]
        Echo[Ultrasonic Echo<br/>∞ waveform data] --> Cochlea[Cochlear Filters<br/>Doppler, delay, amplitude]
        Cochlea --> BatBrain[Auditory Cortex<br/>Distance, texture facts]
    end

    subgraph Bee["Honeybee Vision"]
        Motion[Visual Field<br/>Rapid motion] --> Lamina[Lamina<br/>Optical flow computation]
        Lamina --> BeeBrain[Central Brain<br/>Motion vectors, not pixels]
    end

    style Bat fill:none,stroke:#7c3aed,stroke-width:2px
    style Bee fill:none,stroke:#d97706,stroke-width:2px
    style Echo fill:none,stroke:#6b7280,stroke-width:2px
    style Cochlea fill:none,stroke:#a855f7,stroke-width:2px
    style BatBrain fill:none,stroke:#6366f1,stroke-width:2px
    style Motion fill:none,stroke:#6b7280,stroke-width:2px
    style Lamina fill:none,stroke:#f59e0b,stroke-width:2px
    style BeeBrain fill:none,stroke:#d97706,stroke-width:2px
```

**Il modello comune:**

1. **Donni sensoriali crudi** (problemaM SK1 troppo , troppo rumoroso, troppo altoMSC4dimensionaleMST5
2. **Preprocesso dei confini** (soluzioneM SK1hardware specializzato /wetware riduce,filtriMNK4 struttureMRK5
3. **Trattamento cognitivo** (opera su fatti, non segnali grezziM SK2

Questo non è "inspirazione dalla natura." È l'evoluzione convergente del processo di informazione sotto restrizioni fisiche | ( | energia |, | latenza | МSK4 | larghezza di banda | ). | Le stesse restrizioni si applicano ai sistemi AI |

La mappatura ingegneristica è stretta:

```mermaid
flowchart TD
    subgraph Brain["Biological Vision Pipeline"]
        Photons[Photons] --> Retina[Retina<br/>Edge detection, contrast]
        Retina --> V1[V1 Cortex<br/>Orientation, motion]
        V1 --> IT[Inferotemporal Cortex<br/>Object recognition]
        IT --> PFC[Prefrontal Cortex<br/>Reasoning, synthesis]
    end

    subgraph Engineering["Engineering Vision Pipeline"]
        Pixels[Raw Pixels] --> OpenCV[OpenCV + Heuristics<br/>Sharpness, text-likeliness]
        OpenCV --> Local[Local Models<br/>Florence-2, EAST/CRAFT OCR]
        Local --> Structured[Structured Signals<br/>Bounding boxes, confidence]
        Structured --> LLM[LLM Synthesis<br/>Only when needed]
    end

    Brain -.->|Maps to| Engineering

    style Brain fill:none,stroke:#7c3aed,stroke-width:2px
    style Engineering fill:none,stroke:#2563eb,stroke-width:2px
    style Photons fill:none,stroke:#6b7280,stroke-width:2px
    style Retina fill:none,stroke:#16a34a,stroke-width:2px
    style V1 fill:none,stroke:#059669,stroke-width:2px
    style IT fill:none,stroke:#0891b2,stroke-width:2px
    style PFC fill:none,stroke:#6366f1,stroke-width:2px
    style Pixels fill:none,stroke:#6b7280,stroke-width:2px
    style OpenCV fill:none,stroke:#16a34a,stroke-width:2px
    style Local fill:none,stroke:#059669,stroke-width:2px
    style Structured fill:none,stroke:#0891b2,stroke-width:2px
    style LLM fill:none,stroke:#6366f1,stroke-width:2px
```

**I cervelli non comprendono i pixel.**

La corteccia opera su segnali che sono stati ridotti, filtrati, e strutturati da strati precedentiM SK2 Non è una limitazione MSC3 è ciò che rende l'intelligenza facile da manipolare .

### Consequenze ingegneristiche (Regole di progettazione)

Questo non è un punto di vista filosofico. È il design del sistema:

1. **L'escalazione deve essere fermata.**: I LLM sono di livello 3, non di livello

2. **I limiti di sicurezza devono essere espliciti.**: "Texto rilevato con 0.92 fiduciaM SK3 è un fatto. \"Potrebbe esserci un testoMST6 non èMSST7

3. **Il percorso deve essere deterministico.**: I segnali stessi → lo stesso percorsoM SK2 Nessuna variazione di impulso, nessun effetto termicoMSC4

4. **L'economia dei simboli è una limitazione, non un cambiamento di costi.**: Se il tuo tubo di costruzione'ha una scala dei costi con la dimensione delle informazioni brutteM SK2 state usando l'outil sbagliato .

5. **I fatti hanno bisogno di prove.**: Se si può ' non puntare alla scatola di piegatura, a un'immagineM SK3 o a una regione di forma d'ondaMSC4 non è ' non si tratta di un fatto

**Proof: L'ottimizzazione delle piste da filmare**

Nell'università. [VideoSummarizer](/blog/videosummarizer-scalable-video-intelligence), testoM SK1 solo i filmtrip riducono il costo del token di ~30x mentre *Improvvisare.* La fidelità dell'OCR. Il LLM vede il segnale (Regioni di testo extraiteM SK2 non la scena (frame RGB completiMSC4

Non è un'ottimizzazione. È una correzione di categoria.

---


## Parte 3: Il modello nella pratica

### Il modello generale: Reduced RAG è Map-Reduce per sistemi probabilistici.

Questo è il **RAG ridotto** modello architettonico. Il principio principale: **I canali alimentano i componenti probabilistici.**.

**RAG ridotta è Map-Reduczione applicata ai sistemi probabilistici:**

- **La fase della mappa** (deterministaM SK1parallela,distribuita ): I sensori e i modelli locali estraggono fatti strutturati dai dati scarsi.
- **La fase di riduzione** (probabilistaM SK1sequenziale,centralizzata ): LLM sintetizza sui fatti estrattos.

La RAG tradizionale arriva indietro - recupera i documenti e spera che il LLM estragga i fatti. RAG ridotta **Preleva i fatti prima.** (mapM SK1 poi permette al LLM di sintetizzare (reduce).

Il modello si ripeteva in tutti i sistemi multimodali:

1. **Mappa: Sensori riducono** (filtro e struttura determinista dell'euristica dati scarsi - paralleli tra i frammentiM SK2chunks)
2. **Mappa: Estratto dei modelli locali** (modelli specializzati producono dati con punteggi di fiducia - paralleli per unità di dati
3. **Mappa: Route della politica** (limiti deterministici determinanoM SK1 persistere o escalare - parallelo per fatto)
4. **Reduce: LLMs synthesize** (operare solo su fatti raccoltiM SK1 mai dati scarsi - sintesi sequenziale)

```mermaid
flowchart TD
    subgraph Map["MAP PHASE (Parallel, Deterministic)"]
        Raw[Raw Data<br/>10,000 frames] --> Split{Split}

        Split --> S1[Sensors<br/>Frame 1-1000]
        Split --> S2[Sensors<br/>Frame 1001-2000]
        Split --> S3[Sensors<br/>Frame 2001-3000]
        Split --> SDots[...]

        S1 --> L1[Local Models<br/>Batch 1]
        S2 --> L2[Local Models<br/>Batch 2]
        S3 --> L3[Local Models<br/>Batch 3]
        SDots --> LDots[...]

        L1 --> F1[Facts: 120]
        L2 --> F2[Facts: 98]
        L3 --> F3[Facts: 156]
        LDots --> FDots[...]

        F1 --> Collect[Collect Facts]
        F2 --> Collect
        F3 --> Collect
        FDots --> Collect

        Collect --> Facts[(Facts Database<br/>500 total facts)]
    end

    subgraph Reduce["REDUCE PHASE (Sequential, Probabilistic)"]
        Query[User Query] --> Retrieve[Retrieve Relevant Facts<br/>Filter: 50 facts]
        Facts --> Retrieve
        Retrieve --> LLM[LLM Synthesis<br/>Reason over 50 facts]
        LLM --> Answer[Grounded Answer]
    end

    style Map fill:none,stroke:#16a34a,stroke-width:3px
    style Reduce fill:none,stroke:#6366f1,stroke-width:3px
    style Raw fill:none,stroke:#6b7280,stroke-width:2px
    style Split fill:none,stroke:#16a34a,stroke-width:2px
    style S1 fill:none,stroke:#16a34a,stroke-width:2px
    style S2 fill:none,stroke:#16a34a,stroke-width:2px
    style S3 fill:none,stroke:#16a34a,stroke-width:2px
    style SDots fill:none,stroke:#16a34a,stroke-width:1px,stroke-dasharray: 5 5
    style L1 fill:none,stroke:#059669,stroke-width:2px
    style L2 fill:none,stroke:#059669,stroke-width:2px
    style L3 fill:none,stroke:#059669,stroke-width:2px
    style LDots fill:none,stroke:#059669,stroke-width:1px,stroke-dasharray: 5 5
    style F1 fill:none,stroke:#0891b2,stroke-width:2px
    style F2 fill:none,stroke:#0891b2,stroke-width:2px
    style F3 fill:none,stroke:#0891b2,stroke-width:2px
    style FDots fill:none,stroke:#0891b2,stroke-width:1px,stroke-dasharray: 5 5
    style Collect fill:none,stroke:#16a34a,stroke-width:2px
    style Facts fill:none,stroke:#0891b2,stroke-width:3px
    style Query fill:none,stroke:#6b7280,stroke-width:2px
    style Retrieve fill:none,stroke:#7c3aed,stroke-width:2px
    style LLM fill:none,stroke:#6366f1,stroke-width:2px
    style Answer fill:none,stroke:#16a34a,stroke-width:2px
```

**Documento-prima RAG vs.Rag ridottaM SK2**

| Aspetto | Documento-Prima RAG | RAG ridotta SCartaM SK5ReducereMST6 SST7
|--------|-------------------|-------------|
| **Il modello** | Relevare → Estratto → Sintese S| Mappa M( Estraggere R) D→ Ridurre P(Sintesa L) \|
| **Accuratezza dell'estrazione** | Possibili allucinazioni di LLM | Deterministice, verificabile |
| **Donni conservati** | Documenti
| **Il ruolo di LLM** | Due compiti: estratto + sintetizzare | Un compitoM SK4 sintetizzare solo S|
| **Debuggeribilità** | esaminare le tracce del prompt | esaminare la base di dati dei fatti |
| **La scalabilità** | Bottleneck sequenziale del LLM | Mappa distribuita, Reduzione centralizzata MSC3

### Implementazioni concrete

Tre sistemi di produzione implementano questo schema:

- **[ImageSummarizer](/blog/constrained-fuzzy-image-intelligence)**: Heuristica → Florence-2 OCR → Vision LLM SSK4Escalazione soloM SK5
- **[AudioSummarizer](/blog/audiosummarizer-forensic-audio-characterization)**: Attribuzioni acustiche → Diarizzazione → LLM ( solo tempo di richiestaMSC4
- **[VideoSummarizer](/blog/videosummarizer-scalable-video-intelligence)**: Detezione di sparatorie → Keyframes CSK2 CLIP embeddings

### Perché funziona?

Ecco i numeri reali di VideoSummarizer su un video di 10-minuta (600 secondiM SK2 | | 30fps

| Approco | Accuratezza | Determinismo S| Tocche M|
|----------|----------|-------------|--------|
| **Frame-by-frame LLM** | AllucinazioniM SK1 variazione | Non--determinista | S~27M SSK6
| **Shots → Keyframes → LLM** | Accurato | Extrazione deterministica SSK2 ~150K S|
| **Extrazione del testo della filmstrappa** | La migliore fideltà dell'OCR | Decisivamente determinista SSK2 ~5K S|

**L'architettura giusta è più precisa.** Succede anche che sia più economico 180x ma questo ' è un effetto collaterale di fare la cosa giusta МSK3 non l'obiettivo

---


## Conclusione

Se il vostro sistema AI inizia con un LLM, ne avete già perso il controllo.

L'intelligenza non inizia con il ragionamento. Inizia con la constrazione.

I sensori riducono l'incertezza. I sintetizzatori espandono il significatoM SK1 Confondere i due sistemi di rotture.

Rendere la sintesi l'ultimo passo.

---


## Esempi chiave

- **RAG ridotto**: MappaM SK1Reduczione per sistemi probabilistici. Mappe (estrazione deterministicaMSC4
- **Errore nella categoria**: Trattare qualcosa come appartenenza a un tipo fondamentalemente diverso da quello che è.
- **Disposivo di confine**: Riduce i dati scarsi da grandi dimensioni a dati strutturati da piccoli dimensioni con una precisione nota.
- **Niveau di escalazione**: Fallback a LLM solo quando i metodi deterministici falliscono.
- **Diarizzazione**: Separazione del suonatore nell'audio ( chi ha parlato quando)

---


## Article connessi

- [Reduced RAG: Map-Reduce for Probabilistic Systems](/blog/reduced-rag)
- [VideoSummarizer: RAG ridotto per video](/blog/videosummarizer-scalable-video-intelligence)
- [ImageSummarizer: Intelligenza immagine limitata Fuzzy](/blog/constrained-fuzzy-image-intelligence)
- [AudioSummarizer: Caratificazione audio forense](/blog/audiosummarizer-forensic-audio-characterization)
- [StyloFlow: Signal-Workflow guidati](/blog/styloflow-signal-driven-workflows)