# Varför LLM misslyckas som sensorer ( och vad hjärnor får rätt )

<!-- category -- AI,Architecture,LLM,OCR,Audio,Video,Patterns -->
<datetime class="hidden">2026-01-18T15:33</datetime>

LLMs ( Stora språkmodeller ) används som sensorer **kategori fel**: med hjälp av en sannolikhetssynthesizer där en deterministisk gränsenhet är nödvändig

Det här är inte "'", inte utvecklare, ' "" fel "", . "" De flesta vanliga exempel och instruktioner leder med den enklaste demon ":", "", bara skicka det till modellen ""

Denna artikel handlar om **[Reduzerad RAG](/blog/reduced-rag)** - ett arkitektiskt mönster där **deterministiska pipeline ger probabilistiska komponenter**, inte tvärtom

- **Pipeliner** (sensorer
- **LLMs** använd bara den strukturerade utgången med reduced,
- **Aldrig** skicka rådata direkt till LLMs

exempel: I OCR | ( | Optisk teckenigenkänning | ) | Pipeline | МSK3 | Vision LLM är skala |3, | inte skala **gränsregler** - en arkitektonisk begränsning som förhindrar att använda inappropria verktyg oavsett hur bekväma de uppfattas.

[TOC]

---


## Del 1: Problemet | ( | Varför LLM inte fungerar som sensorer

### Samma misstag , olika former

Här är identiska arkitektoniska misslyckande över olika områden:

- **OCR (Optical Character Recognition**: Att skicka råda videoramar direkt till Vision LLMs istället för att använda texten - liklighet-heuristik plus lokala OCR-modeller
- **Bildanalys**: Han frågade LLMs om " att beskriva den här bilden " istället för att först extrahera strukturerade signaler |
- **Videobehandling**: Att köra LLM-framet - med -framet istället för att upptäcka skjutningar M SK3 att extrahera nyckelframer , och duplicera visuell innehåll
- **Audioanalys**: Att fråga LLM om att dra slutsatser om högtalarens identitet eller ljudkvalitet från råvågformer istället för att använda signalbehandling

```mermaid
flowchart TD
    subgraph Wrong["❌ Common Anti-Pattern"]
        Raw[Raw Data<br/>Pixels, Waveforms, Frames] -->|Direct feed| LLM1[Vision/Audio LLM<br/>$$$, variance, hallucination]
        LLM1 --> Unreliable[Unreliable Output<br/>High cost, non-deterministic]
    end

    style Wrong fill:none,stroke:#dc2626,stroke-width:3px
    style Raw fill:none,stroke:#6b7280,stroke-width:2px
    style LLM1 fill:none,stroke:#dc2626,stroke-width:2px
    style Unreliable fill:none,stroke:#dc2626,stroke-width:2px
```

### Symptomen

Dessa arkitektoniska misstag skapar förutsägbara misslyckanden:

1. **Hallucinationer**: LLMs *måste* utsläppa tokens. Under osäkerhet fyller de luckor med trovärdiga slutsatser. M SK2 Detektorn av texten " eftersom det kan finnas där , inte därför att det finns där **Detta är det centrala problemet.**

2. **icke---deterministisk fel**: Temperatur- och tokenbudjetdrivens varians . Samma insats | → | olika utgångar |. | Debugging blir en statistisk analys

3. **Ressourcenslöseri**: Vare sig du ' betalar per token | ( API | МSK3 | eller kör lokala modeller |( | Ollama | , | llama |. | cpp | ), | du ♫ ' | bränner beräkningar på feluppgiften ♪ . | Lokala LLM sätter inte avgifter per sändning ♪

**Problemet är "'", cost , - , och accuracy .** Ett lokalt hostat LLM-hallucinationer med OCR-resultat är precis lika fellöst som ett dyrt API-uppdrag som gör samma sak.

### Varför händer detta?

Kategorisk fel existerar därför att **en sensor och en syntezator är helt olika verktyg:**

**En sensor är en gränsenhet**

- Reducer världen'dimensionalitet M SK1photoner → strukturerade signaler)
- Emiterar fakta med självförtroende poäng
- Har känt misslyckande former
- billigt, snabbt , upprepadM SK2 deterministiskt

**En LLM är en hög**

- Förstärker graden av frihet ( fakta → präs | , | strukturerad ♫ → | ostrukturerad
- Inget stabilt begrepp för " Inget upptäckts " | | ( det kommer alltid att producera tokens
- Utgången varierar med sammanhanget
- Skalar kostnaden linjärt med inmatningsstorlek
- icke---deterministisk

```mermaid
flowchart LR
    subgraph Sensor["Sensor (Boundary Device)"]
        World[Physical World<br/>∞ dimensions] -->|Reduce| Signal[Structured Signal<br/>Bounded dimensions]
        Signal -->|Confidence| Facts[Facts<br/>± certainty]
    end

    subgraph LLM["LLM (Synthesizer)"]
        Input[Structured Input] -->|Synthesize| Prose[Unstructured Output<br/>High entropy]
        Prose -->|No confidence| Tokens[Token stream<br/>No 'nothing' state]
    end

    style Sensor fill:none,stroke:#16a34a,stroke-width:2px
    style LLM fill:none,stroke:#b45309,stroke-width:2px
    style World fill:none,stroke:#6b7280,stroke-width:2px
    style Signal fill:none,stroke:#2563eb,stroke-width:2px
    style Facts fill:none,stroke:#059669,stroke-width:2px
    style Input fill:none,stroke:#6b7280,stroke-width:2px
    style Prose fill:none,stroke:#d97706,stroke-width:2px
    style Tokens fill:none,stroke:#dc2626,stroke-width:2px
```

Det är därför [StyloFlow](/blog/styloflow-signal-driven-workflows) hanterar signaler som oföränderliga fakta

---


## Del 2: Principet (Sensorer förstM SK2 Synteses sista)

### Vad hjärnor får rätt (Ingen Romans)

Hjärnor börjar inte med resonemang. De börjar med **begränsning**.

Retina är inte hjärnbarken.

- **Kantdetektion** (, på, -, i mitten, ,, utanför, M SK3, i ganglioncellerna i mitten
- **Detektorn för rörelse** (direktionsselektivitet i V
- **Kontrastdämpning** (lateral inhibition
- **Rössdämpning** (

**När sensoriska begränsningar försämras ökar hallucinationerna** lågt ljus , förlorade kanter, tvetydiga ledtrådar . Det är inte en metafor M SK3 det är samma felmodi som LLM-hallucinationer under osäkerheten MSC4 Ingenjörer vet redan detta MST5 när uppströms-SNR faller Mst6 nedströmsklassifier blir instabila M st7

### Perceptuella rutor i olika arter

Det här problemet, -, visar sig i alla djurs perceptionssystem, inte bara i människans syn.

**Fåglars ekolokalisering** (auditoriet):

- **Problemet**: Rent ultraljudsreflektioner innehåller miljoner datapunkter per sekund
- **Lösningen**: Spetsialiserade kohlärbehandlingsfilter för Doppler-skiftningar , tidverzögerningar
- **Resultat**: Strukturerade signaler | ( | avstånd | , | hastighet | МSK3 | textur |) | innan hjärnbarken processeras
- **Teknikparallela**: Audiosignalbearbeitning → egenskaper | | → | diarisering | LLM-synthes

**Honungsbins syn** ( rörelsedetektorn ):

- **Problemet**: Att synfältet förändras snabbt under flyget
- **Lösningen**: Optisk flödesberäkning i lamin ♫ ( ♫ första neuronskivan ♫ МSK2 ♫ inte i centrala hjärnan
- **Resultat**: Kollisionbekämpning fungerar på rörelsevektorn , inte råpixlar
- **Teknikparallela**: Detektor av rörelser i OpenCV

```mermaid
flowchart LR
    subgraph Bat["Bat Echolocation"]
        Echo[Ultrasonic Echo<br/>∞ waveform data] --> Cochlea[Cochlear Filters<br/>Doppler, delay, amplitude]
        Cochlea --> BatBrain[Auditory Cortex<br/>Distance, texture facts]
    end

    subgraph Bee["Honeybee Vision"]
        Motion[Visual Field<br/>Rapid motion] --> Lamina[Lamina<br/>Optical flow computation]
        Lamina --> BeeBrain[Central Brain<br/>Motion vectors, not pixels]
    end

    style Bat fill:none,stroke:#7c3aed,stroke-width:2px
    style Bee fill:none,stroke:#d97706,stroke-width:2px
    style Echo fill:none,stroke:#6b7280,stroke-width:2px
    style Cochlea fill:none,stroke:#a855f7,stroke-width:2px
    style BatBrain fill:none,stroke:#6366f1,stroke-width:2px
    style Motion fill:none,stroke:#6b7280,stroke-width:2px
    style Lamina fill:none,stroke:#f59e0b,stroke-width:2px
    style BeeBrain fill:none,stroke:#d97706,stroke-width:2px
```

**Den vanliga mönstret:**

1. **råsensoriska data** (problem
2. **Grensprocessering** (lösning: specialiserad hårdvaraM SK2 våtware minskar , filter, , strukturer
3. **Kognitiv bearbetning** ( fungerar på fakta , inte råsignaler

Det här är inte "inspiration från naturen ." Det är en konvergent utveckling av informationsbearbeitning under fysiska begränsningar | | energi | latens | bandbredd | ). | De samma begränsningarna gäller AI-system |

Den tekniska kartläggningen är tuff

```mermaid
flowchart TD
    subgraph Brain["Biological Vision Pipeline"]
        Photons[Photons] --> Retina[Retina<br/>Edge detection, contrast]
        Retina --> V1[V1 Cortex<br/>Orientation, motion]
        V1 --> IT[Inferotemporal Cortex<br/>Object recognition]
        IT --> PFC[Prefrontal Cortex<br/>Reasoning, synthesis]
    end

    subgraph Engineering["Engineering Vision Pipeline"]
        Pixels[Raw Pixels] --> OpenCV[OpenCV + Heuristics<br/>Sharpness, text-likeliness]
        OpenCV --> Local[Local Models<br/>Florence-2, EAST/CRAFT OCR]
        Local --> Structured[Structured Signals<br/>Bounding boxes, confidence]
        Structured --> LLM[LLM Synthesis<br/>Only when needed]
    end

    Brain -.->|Maps to| Engineering

    style Brain fill:none,stroke:#7c3aed,stroke-width:2px
    style Engineering fill:none,stroke:#2563eb,stroke-width:2px
    style Photons fill:none,stroke:#6b7280,stroke-width:2px
    style Retina fill:none,stroke:#16a34a,stroke-width:2px
    style V1 fill:none,stroke:#059669,stroke-width:2px
    style IT fill:none,stroke:#0891b2,stroke-width:2px
    style PFC fill:none,stroke:#6366f1,stroke-width:2px
    style Pixels fill:none,stroke:#6b7280,stroke-width:2px
    style OpenCV fill:none,stroke:#16a34a,stroke-width:2px
    style Local fill:none,stroke:#059669,stroke-width:2px
    style Structured fill:none,stroke:#0891b2,stroke-width:2px
    style LLM fill:none,stroke:#6366f1,stroke-width:2px
```

**Hjärnor förstår inte**

Kortexn fungerar på signaler som har blivit reducerade, filterade, , och strukturerade av tidigare lager.. Det är inte en begränsning, det är vad som gör intelligens tillgodlig.

### Teknik konsekvenser (Konstruktionsregler)

Detta är inte en filosofisk utgångspunkt

1. **Escalationen måste bli utspända**: LLMs är i nivåer 3, inte i nivåerna ♫ 1. ♫ Invokera bara när billigare sensorer misslyckas ♫

2. **Konfidens- tröskeln måste vara explicit**: ♫ " ♫ Tekst som upptäcks med ♫ ♫ självförtroende ♫

3. **Rotering måste vara deterministiskt**: Samma signaler → samma väg . Inga promptvarianser | , | inga temperatureffekter

4. **Symbolekonomi är en begränsning, inte ett pris**: Om ditt pipeline 's kostnadsskalar med rådatastorleke , använder du felaktigt verktyg

5. **Faktum behöver bevis**: Om du kan ' inte peka på boundingboxen M SK2 ramenM SK3 eller vågformade områdena , så är det inte

**bevis: Optimering av filmväggen**

I [VideoSummarizer](/blog/videosummarizer-scalable-video-intelligence), text *att förbättra* OCR: s trovärdighet. LLM ser signalen | ( | extraherade textregioner | МSK2 | inte scenen |( | fulla RGB-ramar

Detta är inte en optimering. Det är en kategorikorrigation.

---


## Del 3: Pattern i praktiken

### Det generella mönstret : Reduced RAG är Map-Reduce för Probabilistiska System

Det här är **Reduzerad RAG** arkitektoniska mönster . Kernprincipen: **pipelines mata sannolikhetskomponenter**.

**Reduced RAG is Map-Reduce applied to probabilistic systems:**

- **Kaartsfas** (deterministiska , parallella, fördeladeM SK3 Sensorer och lokala modeller extraherar strukturerade fakta från rådata
- **Reduktionsfas** (probabilistiskt, sekvenseratM SK2 centraliserat ): LLM syntetiserar över de extrahererade fakta

Den traditionella RAG får det här baklänges - den tar fram dokument och hoppas att LLM tar fram fakta . Reduzerad RAG **extraherar fakta först** (mapM SK1 så låter LLM syntetisera (reduce).

Patternet upprepas över alla multimodella system:

1. **Map: Sensorer minskar** (deterministisk heuristik-filter och strukturerad rådata | - | parallella framsteg
2. **Map: Lokala modellers extrakt** (specialiserade modeller producerar fakta med självförtroende poäng - parallell per dataenhet
3. **Karta: Politiska vägar** (deterministiska trösklar bestämmer
4. **Reduera synthesisering av LLMs** (arbeta bara över insamlade fakta , aldrig rådata | | - | sequentiell syntesi

```mermaid
flowchart TD
    subgraph Map["MAP PHASE (Parallel, Deterministic)"]
        Raw[Raw Data<br/>10,000 frames] --> Split{Split}

        Split --> S1[Sensors<br/>Frame 1-1000]
        Split --> S2[Sensors<br/>Frame 1001-2000]
        Split --> S3[Sensors<br/>Frame 2001-3000]
        Split --> SDots[...]

        S1 --> L1[Local Models<br/>Batch 1]
        S2 --> L2[Local Models<br/>Batch 2]
        S3 --> L3[Local Models<br/>Batch 3]
        SDots --> LDots[...]

        L1 --> F1[Facts: 120]
        L2 --> F2[Facts: 98]
        L3 --> F3[Facts: 156]
        LDots --> FDots[...]

        F1 --> Collect[Collect Facts]
        F2 --> Collect
        F3 --> Collect
        FDots --> Collect

        Collect --> Facts[(Facts Database<br/>500 total facts)]
    end

    subgraph Reduce["REDUCE PHASE (Sequential, Probabilistic)"]
        Query[User Query] --> Retrieve[Retrieve Relevant Facts<br/>Filter: 50 facts]
        Facts --> Retrieve
        Retrieve --> LLM[LLM Synthesis<br/>Reason over 50 facts]
        LLM --> Answer[Grounded Answer]
    end

    style Map fill:none,stroke:#16a34a,stroke-width:3px
    style Reduce fill:none,stroke:#6366f1,stroke-width:3px
    style Raw fill:none,stroke:#6b7280,stroke-width:2px
    style Split fill:none,stroke:#16a34a,stroke-width:2px
    style S1 fill:none,stroke:#16a34a,stroke-width:2px
    style S2 fill:none,stroke:#16a34a,stroke-width:2px
    style S3 fill:none,stroke:#16a34a,stroke-width:2px
    style SDots fill:none,stroke:#16a34a,stroke-width:1px,stroke-dasharray: 5 5
    style L1 fill:none,stroke:#059669,stroke-width:2px
    style L2 fill:none,stroke:#059669,stroke-width:2px
    style L3 fill:none,stroke:#059669,stroke-width:2px
    style LDots fill:none,stroke:#059669,stroke-width:1px,stroke-dasharray: 5 5
    style F1 fill:none,stroke:#0891b2,stroke-width:2px
    style F2 fill:none,stroke:#0891b2,stroke-width:2px
    style F3 fill:none,stroke:#0891b2,stroke-width:2px
    style FDots fill:none,stroke:#0891b2,stroke-width:1px,stroke-dasharray: 5 5
    style Collect fill:none,stroke:#16a34a,stroke-width:2px
    style Facts fill:none,stroke:#0891b2,stroke-width:3px
    style Query fill:none,stroke:#6b7280,stroke-width:2px
    style Retrieve fill:none,stroke:#7c3aed,stroke-width:2px
    style LLM fill:none,stroke:#6366f1,stroke-width:2px
    style Answer fill:none,stroke:#16a34a,stroke-width:2px
```

**Dokument-first RAG vs. Reduced RAGM SK2**

| Aspect | Dokumentet-first RAG | Reduktionerad RAG
|--------|-------------------|-------------|
| **Pattern** | Ta upp → Abstrahera ♫ → ♫ Synthesera ♫| ♫ Kaart ♫ МSK4 ♫ Abstrah ♫
| **Extraktionsgenrikthet** | LLM-hallucinationer möjliga
| **Bevarade data** | Dokumenten / knorr | | | Strukturerade fakta | МSK3
| **LLM: s roll** | Två uppgifter
| **Debuggbarhet** | Inspektera promptspår | Inspecera faktadatabasen |
| **Skalbarhet** | Sekvationell LLM flaskkörtel | Distribuerad karta, centraliserad minskning |

### Konkreta implementeringar

Tre produktionssystem implementerar detta mönster

- **[ImageSummarizer](/blog/constrained-fuzzy-image-intelligence)**: Heuristik → Florence-2 OCR → Vision LLM M( endast skalering )
- **[AudioSummarizer](/blog/audiosummarizer-forensic-audio-characterization)**: Akustiska egenskaper
- **[Videosummarizer](/blog/videosummarizer-scalable-video-intelligence)**: Stängddetektorn → Nyckelframer | | → | CLIP-inbäddar | МSK3 | LLM |

### Varför det fungerar?

Här är riktiga siffror från VideoSummarizer på en 10-minuten video (600 sekunderM SK2 30fps = | | 5 frammarmor

| Närhållningssätt | Precision | | | Bestämningsmässighet || | Attkens | МSK4
|----------|----------|-------------|--------|
| **Frame-under-frame LLM** | HalluktionerM SK1 varians | Otrevliga- deterministiska
| **Ständer → Keyframes → LLM** | Verkligen | Deterministisk extraktion ♫ ♫ | ♫
| **Textuttvingning på filmskivan** | Den bästa OCR: s trovärdighet | | | Fully deterministic || |

**Den rätta arkitekturen är mer precisa.** Det råkar också vara billigare. Men det är en biverkningar av att göra det rätta. , är inte målet.

---


## Slutning

Om ditt AI-system börjar med ett LLM, så har du redan förlorat kontroll över det.

Intelligens börjar inte med att resonera.

Sensorer minskar osäkerheten

Synthesera det sista steget.

---


## Nyckelbegrepp

- **Reduzerad RAG**: kartor - Reduktion för sannolikhetssystem. karton (deterministisk extraktion
- **Kategoris fel**: Att behandla något som tillhör en helt annan typ än det är
- **Grensenhet**: Reducerar höga dimensionella rawdata till låga, strukturerade signaler i dimensionell skala med känd precision
- **Escalationskedjan**: Fallback till LLM bara när deterministiska metoder misslyckas (precis | - | angrippade
- **Diarisering**: Lautsprekerseparation i ljud ( vem som talade när

---


## Related Articles

- [Reduced RAG: Map-Reduzerad för Probabilistiska System](/blog/reduced-rag)
- [VideoSummarizer: Reduktion av RAG för video](/blog/videosummarizer-scalable-video-intelligence)
- [ImageSummarizer: Begränsad fuzzy bildintelligens](/blog/constrained-fuzzy-image-intelligence)
- [AudioSummarizer: Förensic Audio Characterization](/blog/audiosummarizer-forensic-audio-characterization)
- [StyloFlow: Signal](/blog/styloflow-signal-driven-workflows)