Back to "Varför LLM misslyckas som sensorer ( och vad hjärnor får rätt )"

This is a viewer only at the moment see the article on how this works.

To update the preview hit Ctrl-Alt-R (or ⌘-Alt-R on Mac) or Enter to refresh. The Save icon lets you save the markdown file to disk

This is a preview from the server running through my markdig pipeline

AI Architecture Audio LLM OCR Patterns Video

Varför LLM misslyckas som sensorer ( och vad hjärnor får rätt )

Sunday, 18 January 2026

LLMs ( Stora språkmodeller ) används som sensorer kategori fel: med hjälp av en sannolikhetssynthesizer där en deterministisk gränsenhet är nödvändig

Det här är inte "'", inte utvecklare, ' "" fel "", . "" De flesta vanliga exempel och instruktioner leder med den enklaste demon ":", "", bara skicka det till modellen ""

Denna artikel handlar om Reduzerad RAG - ett arkitektiskt mönster där deterministiska pipeline ger probabilistiska komponenter, inte tvärtom

  • Pipeliner (sensorer
  • LLMs använd bara den strukturerade utgången med reduced,
  • Aldrig skicka rådata direkt till LLMs

exempel: I OCR | ( | Optisk teckenigenkänning | ) | Pipeline | МSK3 | Vision LLM är skala |3, | inte skala gränsregler - en arkitektonisk begränsning som förhindrar att använda inappropria verktyg oavsett hur bekväma de uppfattas.


Del 1: Problemet | ( | Varför LLM inte fungerar som sensorer

Samma misstag , olika former

Här är identiska arkitektoniska misslyckande över olika områden:

  • OCR (Optical Character Recognition: Att skicka råda videoramar direkt till Vision LLMs istället för att använda texten - liklighet-heuristik plus lokala OCR-modeller
  • Bildanalys: Han frågade LLMs om " att beskriva den här bilden " istället för att först extrahera strukturerade signaler |
  • Videobehandling: Att köra LLM-framet - med -framet istället för att upptäcka skjutningar M SK3 att extrahera nyckelframer , och duplicera visuell innehåll
  • Audioanalys: Att fråga LLM om att dra slutsatser om högtalarens identitet eller ljudkvalitet från råvågformer istället för att använda signalbehandling
flowchart TD
    subgraph Wrong["❌ Common Anti-Pattern"]
        Raw[Raw Data<br/>Pixels, Waveforms, Frames] -->|Direct feed| LLM1[Vision/Audio LLM<br/>$$$, variance, hallucination]
        LLM1 --> Unreliable[Unreliable Output<br/>High cost, non-deterministic]
    end

    style Wrong fill:none,stroke:#dc2626,stroke-width:3px
    style Raw fill:none,stroke:#6b7280,stroke-width:2px
    style LLM1 fill:none,stroke:#dc2626,stroke-width:2px
    style Unreliable fill:none,stroke:#dc2626,stroke-width:2px

Symptomen

Dessa arkitektoniska misstag skapar förutsägbara misslyckanden:

  1. Hallucinationer: LLMs måste utsläppa tokens. Under osäkerhet fyller de luckor med trovärdiga slutsatser. M SK2 Detektorn av texten " eftersom det kan finnas där , inte därför att det finns där Detta är det centrala problemet.

  2. icke---deterministisk fel: Temperatur- och tokenbudjetdrivens varians . Samma insats | → | olika utgångar |. | Debugging blir en statistisk analys

  3. Ressourcenslöseri: Vare sig du ' betalar per token | ( API | МSK3 | eller kör lokala modeller |( | Ollama | , | llama |. | cpp | ), | du ♫ ' | bränner beräkningar på feluppgiften ♪ . | Lokala LLM sätter inte avgifter per sändning ♪

Problemet är "'", cost , - , och accuracy . Ett lokalt hostat LLM-hallucinationer med OCR-resultat är precis lika fellöst som ett dyrt API-uppdrag som gör samma sak.

Varför händer detta?

Kategorisk fel existerar därför att en sensor och en syntezator är helt olika verktyg:

En sensor är en gränsenhet

  • Reducer världen'dimensionalitet M SK1photoner → strukturerade signaler)
  • Emiterar fakta med självförtroende poäng
  • Har känt misslyckande former
  • billigt, snabbt , upprepadM SK2 deterministiskt

En LLM är en hög

  • Förstärker graden av frihet ( fakta → präs | , | strukturerad ♫ → | ostrukturerad
  • Inget stabilt begrepp för " Inget upptäckts " | | ( det kommer alltid att producera tokens
  • Utgången varierar med sammanhanget
  • Skalar kostnaden linjärt med inmatningsstorlek
  • icke---deterministisk
flowchart LR
    subgraph Sensor["Sensor (Boundary Device)"]
        World[Physical World<br/>∞ dimensions] -->|Reduce| Signal[Structured Signal<br/>Bounded dimensions]
        Signal -->|Confidence| Facts[Facts<br/>± certainty]
    end

    subgraph LLM["LLM (Synthesizer)"]
        Input[Structured Input] -->|Synthesize| Prose[Unstructured Output<br/>High entropy]
        Prose -->|No confidence| Tokens[Token stream<br/>No 'nothing' state]
    end

    style Sensor fill:none,stroke:#16a34a,stroke-width:2px
    style LLM fill:none,stroke:#b45309,stroke-width:2px
    style World fill:none,stroke:#6b7280,stroke-width:2px
    style Signal fill:none,stroke:#2563eb,stroke-width:2px
    style Facts fill:none,stroke:#059669,stroke-width:2px
    style Input fill:none,stroke:#6b7280,stroke-width:2px
    style Prose fill:none,stroke:#d97706,stroke-width:2px
    style Tokens fill:none,stroke:#dc2626,stroke-width:2px

Det är därför StyloFlow hanterar signaler som oföränderliga fakta


Del 2: Principet (Sensorer förstM SK2 Synteses sista)

Vad hjärnor får rätt (Ingen Romans)

Hjärnor börjar inte med resonemang. De börjar med begränsning.

Retina är inte hjärnbarken.

  • Kantdetektion (, på, -, i mitten, ,, utanför, M SK3, i ganglioncellerna i mitten
  • Detektorn för rörelse (direktionsselektivitet i V
  • Kontrastdämpning (lateral inhibition
  • Rössdämpning (

När sensoriska begränsningar försämras ökar hallucinationerna lågt ljus , förlorade kanter, tvetydiga ledtrådar . Det är inte en metafor M SK3 det är samma felmodi som LLM-hallucinationer under osäkerheten MSC4 Ingenjörer vet redan detta MST5 när uppströms-SNR faller Mst6 nedströmsklassifier blir instabila M st7

Perceptuella rutor i olika arter

Det här problemet, -, visar sig i alla djurs perceptionssystem, inte bara i människans syn.

Fåglars ekolokalisering (auditoriet):

  • Problemet: Rent ultraljudsreflektioner innehåller miljoner datapunkter per sekund
  • Lösningen: Spetsialiserade kohlärbehandlingsfilter för Doppler-skiftningar , tidverzögerningar
  • Resultat: Strukturerade signaler | ( | avstånd | , | hastighet | МSK3 | textur |) | innan hjärnbarken processeras
  • Teknikparallela: Audiosignalbearbeitning → egenskaper | | → | diarisering | LLM-synthes

Honungsbins syn ( rörelsedetektorn ):

  • Problemet: Att synfältet förändras snabbt under flyget
  • Lösningen: Optisk flödesberäkning i lamin ♫ ( ♫ första neuronskivan ♫ МSK2 ♫ inte i centrala hjärnan
  • Resultat: Kollisionbekämpning fungerar på rörelsevektorn , inte råpixlar
  • Teknikparallela: Detektor av rörelser i OpenCV
flowchart LR
    subgraph Bat["Bat Echolocation"]
        Echo[Ultrasonic Echo<br/>∞ waveform data] --> Cochlea[Cochlear Filters<br/>Doppler, delay, amplitude]
        Cochlea --> BatBrain[Auditory Cortex<br/>Distance, texture facts]
    end

    subgraph Bee["Honeybee Vision"]
        Motion[Visual Field<br/>Rapid motion] --> Lamina[Lamina<br/>Optical flow computation]
        Lamina --> BeeBrain[Central Brain<br/>Motion vectors, not pixels]
    end

    style Bat fill:none,stroke:#7c3aed,stroke-width:2px
    style Bee fill:none,stroke:#d97706,stroke-width:2px
    style Echo fill:none,stroke:#6b7280,stroke-width:2px
    style Cochlea fill:none,stroke:#a855f7,stroke-width:2px
    style BatBrain fill:none,stroke:#6366f1,stroke-width:2px
    style Motion fill:none,stroke:#6b7280,stroke-width:2px
    style Lamina fill:none,stroke:#f59e0b,stroke-width:2px
    style BeeBrain fill:none,stroke:#d97706,stroke-width:2px

Den vanliga mönstret:

  1. råsensoriska data (problem
  2. Grensprocessering (lösning: specialiserad hårdvaraM SK2 våtware minskar , filter, , strukturer
  3. Kognitiv bearbetning ( fungerar på fakta , inte råsignaler

Det här är inte "inspiration från naturen ." Det är en konvergent utveckling av informationsbearbeitning under fysiska begränsningar | | energi | latens | bandbredd | ). | De samma begränsningarna gäller AI-system |

Den tekniska kartläggningen är tuff

flowchart TD
    subgraph Brain["Biological Vision Pipeline"]
        Photons[Photons] --> Retina[Retina<br/>Edge detection, contrast]
        Retina --> V1[V1 Cortex<br/>Orientation, motion]
        V1 --> IT[Inferotemporal Cortex<br/>Object recognition]
        IT --> PFC[Prefrontal Cortex<br/>Reasoning, synthesis]
    end

    subgraph Engineering["Engineering Vision Pipeline"]
        Pixels[Raw Pixels] --> OpenCV[OpenCV + Heuristics<br/>Sharpness, text-likeliness]
        OpenCV --> Local[Local Models<br/>Florence-2, EAST/CRAFT OCR]
        Local --> Structured[Structured Signals<br/>Bounding boxes, confidence]
        Structured --> LLM[LLM Synthesis<br/>Only when needed]
    end

    Brain -.->|Maps to| Engineering

    style Brain fill:none,stroke:#7c3aed,stroke-width:2px
    style Engineering fill:none,stroke:#2563eb,stroke-width:2px
    style Photons fill:none,stroke:#6b7280,stroke-width:2px
    style Retina fill:none,stroke:#16a34a,stroke-width:2px
    style V1 fill:none,stroke:#059669,stroke-width:2px
    style IT fill:none,stroke:#0891b2,stroke-width:2px
    style PFC fill:none,stroke:#6366f1,stroke-width:2px
    style Pixels fill:none,stroke:#6b7280,stroke-width:2px
    style OpenCV fill:none,stroke:#16a34a,stroke-width:2px
    style Local fill:none,stroke:#059669,stroke-width:2px
    style Structured fill:none,stroke:#0891b2,stroke-width:2px
    style LLM fill:none,stroke:#6366f1,stroke-width:2px

Hjärnor förstår inte

Kortexn fungerar på signaler som har blivit reducerade, filterade, , och strukturerade av tidigare lager.. Det är inte en begränsning, det är vad som gör intelligens tillgodlig.

Teknik konsekvenser (Konstruktionsregler)

Detta är inte en filosofisk utgångspunkt

  1. Escalationen måste bli utspända: LLMs är i nivåer 3, inte i nivåerna ♫ 1. ♫ Invokera bara när billigare sensorer misslyckas ♫

  2. Konfidens- tröskeln måste vara explicit: ♫ " ♫ Tekst som upptäcks med ♫ ♫ självförtroende ♫

  3. Rotering måste vara deterministiskt: Samma signaler → samma väg . Inga promptvarianser | , | inga temperatureffekter

  4. Symbolekonomi är en begränsning, inte ett pris: Om ditt pipeline 's kostnadsskalar med rådatastorleke , använder du felaktigt verktyg

  5. Faktum behöver bevis: Om du kan ' inte peka på boundingboxen M SK2 ramenM SK3 eller vågformade områdena , så är det inte

bevis: Optimering av filmväggen

I VideoSummarizer, text att förbättra OCR: s trovärdighet. LLM ser signalen | ( | extraherade textregioner | МSK2 | inte scenen |( | fulla RGB-ramar

Detta är inte en optimering. Det är en kategorikorrigation.


Del 3: Pattern i praktiken

Det generella mönstret : Reduced RAG är Map-Reduce för Probabilistiska System

Det här är Reduzerad RAG arkitektoniska mönster . Kernprincipen: pipelines mata sannolikhetskomponenter.

Reduced RAG is Map-Reduce applied to probabilistic systems:

  • Kaartsfas (deterministiska , parallella, fördeladeM SK3 Sensorer och lokala modeller extraherar strukturerade fakta från rådata
  • Reduktionsfas (probabilistiskt, sekvenseratM SK2 centraliserat ): LLM syntetiserar över de extrahererade fakta

Den traditionella RAG får det här baklänges - den tar fram dokument och hoppas att LLM tar fram fakta . Reduzerad RAG extraherar fakta först (mapM SK1 så låter LLM syntetisera (reduce).

Patternet upprepas över alla multimodella system:

  1. Map: Sensorer minskar (deterministisk heuristik-filter och strukturerad rådata | - | parallella framsteg
  2. Map: Lokala modellers extrakt (specialiserade modeller producerar fakta med självförtroende poäng - parallell per dataenhet
  3. Karta: Politiska vägar (deterministiska trösklar bestämmer
  4. Reduera synthesisering av LLMs (arbeta bara över insamlade fakta , aldrig rådata | | - | sequentiell syntesi
flowchart TD
    subgraph Map["MAP PHASE (Parallel, Deterministic)"]
        Raw[Raw Data<br/>10,000 frames] --> Split{Split}

        Split --> S1[Sensors<br/>Frame 1-1000]
        Split --> S2[Sensors<br/>Frame 1001-2000]
        Split --> S3[Sensors<br/>Frame 2001-3000]
        Split --> SDots[...]

        S1 --> L1[Local Models<br/>Batch 1]
        S2 --> L2[Local Models<br/>Batch 2]
        S3 --> L3[Local Models<br/>Batch 3]
        SDots --> LDots[...]

        L1 --> F1[Facts: 120]
        L2 --> F2[Facts: 98]
        L3 --> F3[Facts: 156]
        LDots --> FDots[...]

        F1 --> Collect[Collect Facts]
        F2 --> Collect
        F3 --> Collect
        FDots --> Collect

        Collect --> Facts[(Facts Database<br/>500 total facts)]
    end

    subgraph Reduce["REDUCE PHASE (Sequential, Probabilistic)"]
        Query[User Query] --> Retrieve[Retrieve Relevant Facts<br/>Filter: 50 facts]
        Facts --> Retrieve
        Retrieve --> LLM[LLM Synthesis<br/>Reason over 50 facts]
        LLM --> Answer[Grounded Answer]
    end

    style Map fill:none,stroke:#16a34a,stroke-width:3px
    style Reduce fill:none,stroke:#6366f1,stroke-width:3px
    style Raw fill:none,stroke:#6b7280,stroke-width:2px
    style Split fill:none,stroke:#16a34a,stroke-width:2px
    style S1 fill:none,stroke:#16a34a,stroke-width:2px
    style S2 fill:none,stroke:#16a34a,stroke-width:2px
    style S3 fill:none,stroke:#16a34a,stroke-width:2px
    style SDots fill:none,stroke:#16a34a,stroke-width:1px,stroke-dasharray: 5 5
    style L1 fill:none,stroke:#059669,stroke-width:2px
    style L2 fill:none,stroke:#059669,stroke-width:2px
    style L3 fill:none,stroke:#059669,stroke-width:2px
    style LDots fill:none,stroke:#059669,stroke-width:1px,stroke-dasharray: 5 5
    style F1 fill:none,stroke:#0891b2,stroke-width:2px
    style F2 fill:none,stroke:#0891b2,stroke-width:2px
    style F3 fill:none,stroke:#0891b2,stroke-width:2px
    style FDots fill:none,stroke:#0891b2,stroke-width:1px,stroke-dasharray: 5 5
    style Collect fill:none,stroke:#16a34a,stroke-width:2px
    style Facts fill:none,stroke:#0891b2,stroke-width:3px
    style Query fill:none,stroke:#6b7280,stroke-width:2px
    style Retrieve fill:none,stroke:#7c3aed,stroke-width:2px
    style LLM fill:none,stroke:#6366f1,stroke-width:2px
    style Answer fill:none,stroke:#16a34a,stroke-width:2px

Dokument-first RAG vs. Reduced RAGM SK2

Aspect Dokumentet-first RAG Reduktionerad RAG
Pattern Ta upp → Abstrahera ♫ → ♫ Synthesera ♫ ♫ Kaart ♫ МSK4 ♫ Abstrah ♫
Extraktionsgenrikthet LLM-hallucinationer möjliga
Bevarade data Dokumenten / knorr Strukturerade fakta МSK3
LLM: s roll Två uppgifter
Debuggbarhet Inspektera promptspår Inspecera faktadatabasen
Skalbarhet Sekvationell LLM flaskkörtel Distribuerad karta, centraliserad minskning

Konkreta implementeringar

Tre produktionssystem implementerar detta mönster

Varför det fungerar?

Här är riktiga siffror från VideoSummarizer på en 10-minuten video (600 sekunderM SK2 30fps = | | 5 frammarmor

Närhållningssätt Precision Bestämningsmässighet Attkens МSK4
Frame-under-frame LLM HalluktionerM SK1 varians Otrevliga- deterministiska
Ständer → Keyframes → LLM Verkligen Deterministisk extraktion ♫ ♫
Textuttvingning på filmskivan Den bästa OCR: s trovärdighet Fully deterministic

Den rätta arkitekturen är mer precisa. Det råkar också vara billigare. Men det är en biverkningar av att göra det rätta. , är inte målet.


Slutning

Om ditt AI-system börjar med ett LLM, så har du redan förlorat kontroll över det.

Intelligens börjar inte med att resonera.

Sensorer minskar osäkerheten

Synthesera det sista steget.


Nyckelbegrepp

  • Reduzerad RAG: kartor - Reduktion för sannolikhetssystem. karton (deterministisk extraktion
  • Kategoris fel: Att behandla något som tillhör en helt annan typ än det är
  • Grensenhet: Reducerar höga dimensionella rawdata till låga, strukturerade signaler i dimensionell skala med känd precision
  • Escalationskedjan: Fallback till LLM bara när deterministiska metoder misslyckas (precis | - | angrippade
  • Diarisering: Lautsprekerseparation i ljud ( vem som talade när

logo

© 2026 Scott Galloway — Unlicense — All content and source code on this site is free to use, copy, modify, and sell.