LLMs ( Stora språkmodeller ) används som sensorer kategori fel: med hjälp av en sannolikhetssynthesizer där en deterministisk gränsenhet är nödvändig
Det här är inte "'", inte utvecklare, ' "" fel "", . "" De flesta vanliga exempel och instruktioner leder med den enklaste demon ":", "", bara skicka det till modellen ""
Denna artikel handlar om Reduzerad RAG - ett arkitektiskt mönster där deterministiska pipeline ger probabilistiska komponenter, inte tvärtom
exempel: I OCR | ( | Optisk teckenigenkänning | ) | Pipeline | МSK3 | Vision LLM är skala |3, | inte skala gränsregler - en arkitektonisk begränsning som förhindrar att använda inappropria verktyg oavsett hur bekväma de uppfattas.
Här är identiska arkitektoniska misslyckande över olika områden:
flowchart TD
subgraph Wrong["❌ Common Anti-Pattern"]
Raw[Raw Data<br/>Pixels, Waveforms, Frames] -->|Direct feed| LLM1[Vision/Audio LLM<br/>$$$, variance, hallucination]
LLM1 --> Unreliable[Unreliable Output<br/>High cost, non-deterministic]
end
style Wrong fill:none,stroke:#dc2626,stroke-width:3px
style Raw fill:none,stroke:#6b7280,stroke-width:2px
style LLM1 fill:none,stroke:#dc2626,stroke-width:2px
style Unreliable fill:none,stroke:#dc2626,stroke-width:2px
Dessa arkitektoniska misstag skapar förutsägbara misslyckanden:
Hallucinationer: LLMs måste utsläppa tokens. Under osäkerhet fyller de luckor med trovärdiga slutsatser. M SK2 Detektorn av texten " eftersom det kan finnas där , inte därför att det finns där Detta är det centrala problemet.
icke---deterministisk fel: Temperatur- och tokenbudjetdrivens varians . Samma insats | → | olika utgångar |. | Debugging blir en statistisk analys
Ressourcenslöseri: Vare sig du ' betalar per token | ( API | МSK3 | eller kör lokala modeller |( | Ollama | , | llama |. | cpp | ), | du ♫ ' | bränner beräkningar på feluppgiften ♪ . | Lokala LLM sätter inte avgifter per sändning ♪
Problemet är "'", cost , - , och accuracy . Ett lokalt hostat LLM-hallucinationer med OCR-resultat är precis lika fellöst som ett dyrt API-uppdrag som gör samma sak.
Kategorisk fel existerar därför att en sensor och en syntezator är helt olika verktyg:
En sensor är en gränsenhet
En LLM är en hög
flowchart LR
subgraph Sensor["Sensor (Boundary Device)"]
World[Physical World<br/>∞ dimensions] -->|Reduce| Signal[Structured Signal<br/>Bounded dimensions]
Signal -->|Confidence| Facts[Facts<br/>± certainty]
end
subgraph LLM["LLM (Synthesizer)"]
Input[Structured Input] -->|Synthesize| Prose[Unstructured Output<br/>High entropy]
Prose -->|No confidence| Tokens[Token stream<br/>No 'nothing' state]
end
style Sensor fill:none,stroke:#16a34a,stroke-width:2px
style LLM fill:none,stroke:#b45309,stroke-width:2px
style World fill:none,stroke:#6b7280,stroke-width:2px
style Signal fill:none,stroke:#2563eb,stroke-width:2px
style Facts fill:none,stroke:#059669,stroke-width:2px
style Input fill:none,stroke:#6b7280,stroke-width:2px
style Prose fill:none,stroke:#d97706,stroke-width:2px
style Tokens fill:none,stroke:#dc2626,stroke-width:2px
Det är därför StyloFlow hanterar signaler som oföränderliga fakta
Hjärnor börjar inte med resonemang. De börjar med begränsning.
Retina är inte hjärnbarken.
När sensoriska begränsningar försämras ökar hallucinationerna lågt ljus , förlorade kanter, tvetydiga ledtrådar . Det är inte en metafor M SK3 det är samma felmodi som LLM-hallucinationer under osäkerheten MSC4 Ingenjörer vet redan detta MST5 när uppströms-SNR faller Mst6 nedströmsklassifier blir instabila M st7
Det här problemet, -, visar sig i alla djurs perceptionssystem, inte bara i människans syn.
Fåglars ekolokalisering (auditoriet):
Honungsbins syn ( rörelsedetektorn ):
flowchart LR
subgraph Bat["Bat Echolocation"]
Echo[Ultrasonic Echo<br/>∞ waveform data] --> Cochlea[Cochlear Filters<br/>Doppler, delay, amplitude]
Cochlea --> BatBrain[Auditory Cortex<br/>Distance, texture facts]
end
subgraph Bee["Honeybee Vision"]
Motion[Visual Field<br/>Rapid motion] --> Lamina[Lamina<br/>Optical flow computation]
Lamina --> BeeBrain[Central Brain<br/>Motion vectors, not pixels]
end
style Bat fill:none,stroke:#7c3aed,stroke-width:2px
style Bee fill:none,stroke:#d97706,stroke-width:2px
style Echo fill:none,stroke:#6b7280,stroke-width:2px
style Cochlea fill:none,stroke:#a855f7,stroke-width:2px
style BatBrain fill:none,stroke:#6366f1,stroke-width:2px
style Motion fill:none,stroke:#6b7280,stroke-width:2px
style Lamina fill:none,stroke:#f59e0b,stroke-width:2px
style BeeBrain fill:none,stroke:#d97706,stroke-width:2px
Den vanliga mönstret:
Det här är inte "inspiration från naturen ." Det är en konvergent utveckling av informationsbearbeitning under fysiska begränsningar | | energi | latens | bandbredd | ). | De samma begränsningarna gäller AI-system |
Den tekniska kartläggningen är tuff
flowchart TD
subgraph Brain["Biological Vision Pipeline"]
Photons[Photons] --> Retina[Retina<br/>Edge detection, contrast]
Retina --> V1[V1 Cortex<br/>Orientation, motion]
V1 --> IT[Inferotemporal Cortex<br/>Object recognition]
IT --> PFC[Prefrontal Cortex<br/>Reasoning, synthesis]
end
subgraph Engineering["Engineering Vision Pipeline"]
Pixels[Raw Pixels] --> OpenCV[OpenCV + Heuristics<br/>Sharpness, text-likeliness]
OpenCV --> Local[Local Models<br/>Florence-2, EAST/CRAFT OCR]
Local --> Structured[Structured Signals<br/>Bounding boxes, confidence]
Structured --> LLM[LLM Synthesis<br/>Only when needed]
end
Brain -.->|Maps to| Engineering
style Brain fill:none,stroke:#7c3aed,stroke-width:2px
style Engineering fill:none,stroke:#2563eb,stroke-width:2px
style Photons fill:none,stroke:#6b7280,stroke-width:2px
style Retina fill:none,stroke:#16a34a,stroke-width:2px
style V1 fill:none,stroke:#059669,stroke-width:2px
style IT fill:none,stroke:#0891b2,stroke-width:2px
style PFC fill:none,stroke:#6366f1,stroke-width:2px
style Pixels fill:none,stroke:#6b7280,stroke-width:2px
style OpenCV fill:none,stroke:#16a34a,stroke-width:2px
style Local fill:none,stroke:#059669,stroke-width:2px
style Structured fill:none,stroke:#0891b2,stroke-width:2px
style LLM fill:none,stroke:#6366f1,stroke-width:2px
Hjärnor förstår inte
Kortexn fungerar på signaler som har blivit reducerade, filterade, , och strukturerade av tidigare lager.. Det är inte en begränsning, det är vad som gör intelligens tillgodlig.
Detta är inte en filosofisk utgångspunkt
Escalationen måste bli utspända: LLMs är i nivåer 3, inte i nivåerna ♫ 1. ♫ Invokera bara när billigare sensorer misslyckas ♫
Konfidens- tröskeln måste vara explicit: ♫ " ♫ Tekst som upptäcks med ♫ ♫ självförtroende ♫
Rotering måste vara deterministiskt: Samma signaler → samma väg . Inga promptvarianser | , | inga temperatureffekter
Symbolekonomi är en begränsning, inte ett pris: Om ditt pipeline 's kostnadsskalar med rådatastorleke , använder du felaktigt verktyg
Faktum behöver bevis: Om du kan ' inte peka på boundingboxen M SK2 ramenM SK3 eller vågformade områdena , så är det inte
bevis: Optimering av filmväggen
I VideoSummarizer, text att förbättra OCR: s trovärdighet. LLM ser signalen | ( | extraherade textregioner | МSK2 | inte scenen |( | fulla RGB-ramar
Detta är inte en optimering. Det är en kategorikorrigation.
Det här är Reduzerad RAG arkitektoniska mönster . Kernprincipen: pipelines mata sannolikhetskomponenter.
Reduced RAG is Map-Reduce applied to probabilistic systems:
Den traditionella RAG får det här baklänges - den tar fram dokument och hoppas att LLM tar fram fakta . Reduzerad RAG extraherar fakta först (mapM SK1 så låter LLM syntetisera (reduce).
Patternet upprepas över alla multimodella system:
flowchart TD
subgraph Map["MAP PHASE (Parallel, Deterministic)"]
Raw[Raw Data<br/>10,000 frames] --> Split{Split}
Split --> S1[Sensors<br/>Frame 1-1000]
Split --> S2[Sensors<br/>Frame 1001-2000]
Split --> S3[Sensors<br/>Frame 2001-3000]
Split --> SDots[...]
S1 --> L1[Local Models<br/>Batch 1]
S2 --> L2[Local Models<br/>Batch 2]
S3 --> L3[Local Models<br/>Batch 3]
SDots --> LDots[...]
L1 --> F1[Facts: 120]
L2 --> F2[Facts: 98]
L3 --> F3[Facts: 156]
LDots --> FDots[...]
F1 --> Collect[Collect Facts]
F2 --> Collect
F3 --> Collect
FDots --> Collect
Collect --> Facts[(Facts Database<br/>500 total facts)]
end
subgraph Reduce["REDUCE PHASE (Sequential, Probabilistic)"]
Query[User Query] --> Retrieve[Retrieve Relevant Facts<br/>Filter: 50 facts]
Facts --> Retrieve
Retrieve --> LLM[LLM Synthesis<br/>Reason over 50 facts]
LLM --> Answer[Grounded Answer]
end
style Map fill:none,stroke:#16a34a,stroke-width:3px
style Reduce fill:none,stroke:#6366f1,stroke-width:3px
style Raw fill:none,stroke:#6b7280,stroke-width:2px
style Split fill:none,stroke:#16a34a,stroke-width:2px
style S1 fill:none,stroke:#16a34a,stroke-width:2px
style S2 fill:none,stroke:#16a34a,stroke-width:2px
style S3 fill:none,stroke:#16a34a,stroke-width:2px
style SDots fill:none,stroke:#16a34a,stroke-width:1px,stroke-dasharray: 5 5
style L1 fill:none,stroke:#059669,stroke-width:2px
style L2 fill:none,stroke:#059669,stroke-width:2px
style L3 fill:none,stroke:#059669,stroke-width:2px
style LDots fill:none,stroke:#059669,stroke-width:1px,stroke-dasharray: 5 5
style F1 fill:none,stroke:#0891b2,stroke-width:2px
style F2 fill:none,stroke:#0891b2,stroke-width:2px
style F3 fill:none,stroke:#0891b2,stroke-width:2px
style FDots fill:none,stroke:#0891b2,stroke-width:1px,stroke-dasharray: 5 5
style Collect fill:none,stroke:#16a34a,stroke-width:2px
style Facts fill:none,stroke:#0891b2,stroke-width:3px
style Query fill:none,stroke:#6b7280,stroke-width:2px
style Retrieve fill:none,stroke:#7c3aed,stroke-width:2px
style LLM fill:none,stroke:#6366f1,stroke-width:2px
style Answer fill:none,stroke:#16a34a,stroke-width:2px
Dokument-first RAG vs. Reduced RAGM SK2
| Aspect | Dokumentet-first RAG | Reduktionerad RAG | |||
|---|---|---|---|---|---|
| Pattern | Ta upp → Abstrahera ♫ → ♫ Synthesera ♫ | ♫ Kaart ♫ МSK4 ♫ Abstrah ♫ | |||
| Extraktionsgenrikthet | LLM-hallucinationer möjliga | ||||
| Bevarade data | Dokumenten / knorr | Strukturerade fakta | МSK3 | ||
| LLM: s roll | Två uppgifter | ||||
| Debuggbarhet | Inspektera promptspår | Inspecera faktadatabasen | |||
| Skalbarhet | Sekvationell LLM flaskkörtel | Distribuerad karta, centraliserad minskning |
Tre produktionssystem implementerar detta mönster
Här är riktiga siffror från VideoSummarizer på en 10-minuten video (600 sekunderM SK2 30fps = | | 5 frammarmor
| Närhållningssätt | Precision | Bestämningsmässighet | Attkens | МSK4 | ||||
|---|---|---|---|---|---|---|---|---|
| Frame-under-frame LLM | HalluktionerM SK1 varians | Otrevliga- deterministiska | ||||||
| Ständer → Keyframes → LLM | Verkligen | Deterministisk extraktion ♫ ♫ | ♫ | |||||
| Textuttvingning på filmskivan | Den bästa OCR: s trovärdighet | Fully deterministic |
Den rätta arkitekturen är mer precisa. Det råkar också vara billigare. Men det är en biverkningar av att göra det rätta. , är inte målet.
Om ditt AI-system börjar med ett LLM, så har du redan förlorat kontroll över det.
Intelligens börjar inte med att resonera.
Sensorer minskar osäkerheten
Synthesera det sista steget.
© 2026 Scott Galloway — Unlicense — All content and source code on this site is free to use, copy, modify, and sell.