This is a viewer only at the moment see the article on how this works.
To update the preview hit Ctrl-Alt-R (or ⌘-Alt-R on Mac) or Enter to refresh. The Save icon lets you save the markdown file to disk
This is a preview from the server running through my markdig pipeline
Sunday, 28 December 2025
Los LLM pequeños y locales se enmarcan a menudo como la alternativa barata a los modelos fronterizos. Ese encuadre es incorrecto. No son una versión degradada de la misma cosa. Son una opción arquitectónica diferente, seleccionada para control, predictibilidad, y Modos de fallo supervivibles.
Soy tan culpable como cualquiera por empujar la narrativa de "son libres"... como si ese fuera el único factor decisivo. Pero como elegir una base de datos / plataforma de alojamiento para un sistema que necesita entender ¿Qué concesiones estás haciendo?.
Usando un modelo pequeño a través de Ollama, LM Studio, ONNX Runtime, o similar no se trata (sólo) de ahorrar dinero. Se trata de elegir donde se permite la existencia de no-determinismo.
Los grandes modelos fronterizos son más amplios y fluidos, densifican más la lógica humana expresada, abarcan más dominios y producen más rastros de razonamiento convincentes. más peligroso en sistemas que requieren garantías.
Los modelos fronterizos tienen sentido cuando se requiere amplitud y las salidas son asesoradas por diseño - redacción creativa, exploración abierta o síntesis en dominios desconocidos.
Sus fracasos son semántica en lugar de estructural. Este es el error de categoría: tratar un componente probabilístico como si fuera un límite del sistema. Generan salidas de aspecto válido que están mal de manera sutil. Esos fallos son:
Los modelos pequeños fallan de manera diferente.
Cuando un modelo pequeño se confunde, tiende a:
Estos son fallas baratas. Son detectables con simple validación. Activan retrocesos o retrocesos inmediatamente. No avanzan silenciosamente el estado.
Esto no es una debilidad, es una característica.
Esta perspicacia no es teoría abstracta - es la base de la Diez mandamientos de uso de LLM. El principio básico:
Los LLM interpretan la realidad. Nunca se les debe permitir definirla.
Cuando sigues este principio, descubres algo sorprendente: Dejas de necesitar modelos caros. Un modelo de parámetro 7B que se ejecuta localmente puede clasificar, resumir y generar hipótesis muy bien - porque los sistemas deterministas alrededor de él manejan todo lo que realmente necesita ser correcto.
Los modelos pequeños no son "débiles" - a menudo son suficiente porque el problema ya se ha reducido para el momento en que llega a ellos.
Los modelos de frontera le están vendiendo fiabilidad que debe construir usted mismo.
Al igual que DuckDB no es "cheap SQL" y Postgres no es "peor Azure SQL", pequeños LLM ocupan un diferente punto en el espacio de diseño. Usted los elige cuando:
|---------|----------------------| | Localidad Se ejecuta en su hardware, su red, su jurisdicción | Auditabilidad Cada inferencia es registrada, reproducible, inspeccionable | Radio de explosión Los fracasos son contenidos, no propagados a través de las cadenas API | Ejecución de la corrección Validación ocurre fuera del modelo | No-determinismo consolidado La incertidumbre está fuertemente constreñida
Esto no es hipotético, mis proyectos demuestran este patrón repetidamente:
Mi implementación GraphRAG ofrece tres modos:
|------|-----------|----------| | Heurística 0 por trozo Puro determinismo vía IDF + estructura | Híbrido 1 por documento Pequeño modelo valida candidatos | LLM 2 por trozo Máxima calidad cuando sea necesario
Los modo híbrido es el punto dulce: la extracción heurística encuentra candidatos (deterministas), luego un pequeño modelo local los valida y enriquece. Una llamada LLM por documento, no por trozo.
Con Ollama corriendo localmente, el costo es de $0. Pero no es por eso que lo uso - ahorro de costos son un efecto secundario de la abstracción correcta, no el objetivo. Lo uso porque los fracasos son baratos y obvios.
Búsqueda semántica con ONNX y Qdrant muestra otro patrón: algunas tareas no necesitan un LLM en absoluto. Las incrustaciones BERT a través de ONNX Runtime le dan:
Por búsqueda híbridaEl LLM sólo aparece en el momento de la síntesis - e incluso entonces, un pequeño modelo local funciona bien porque es Explicación estructura que los sistemas deterministas ya han validado.
DocSummarizer encarna esta filosofía:
El LLM es el último paso, trabajando en contenido pre-validado, pre-estructurado. Puede fallar - y cuando lo hace, el fallo es obvio porque la estructura ya es correcta.
TinyLLM demuestra el uso local de LLM en una aplicación de escritorio de Windows. Soporta:
La interfaz de chat es probabilística. La memoria, el manejo de archivos y la gestión del estado son deterministas. El fracaso en uno no corrompe al otro.
Los modelos de frontera son herramientas poderosas cuando se usan deliberadamente, pero aumentan el poder expresivo más rápido de lo que reducen el riesgo. sin ocultar la verdad o la responsabilidad.
La pregunta correcta no es "¿qué modelo es el mejor?"
Es:
Si la respuesta implica estado, efectos secundarios, dinero, política, o garantías - el modelo nunca debe estar a cargo. Y si el modelo sólo está allí para clasificar, resumir, clasificar, o proponer hipótesis, un pequeño modelo local es a menudo el elección correcta, no el económico.
Esta es la arquitectura que funciona:
┌─────────────────────────────────────────────────────┐
│ DETERMINISTIC LAYER │
│ State machines, queues, validation, storage │
│ (DuckDB, Postgres, Redis, file systems) │
└─────────────────────────────────────────────────────┘
│
▼
┌─────────────────────────────────────────────────────┐
│ INTERFACE LAYER │
│ Schema validation, retries, fallbacks │
│ (Polly, FluentValidation, custom guards) │
└─────────────────────────────────────────────────────┘
│
▼
┌─────────────────────────────────────────────────────┐
│ PROBABILISTIC LAYER │
│ Classification, summarisation, hypothesis gen │
│ (Ollama, ONNX, small local models) │
└─────────────────────────────────────────────────────┘
El LLM está en la inferior, no la parte superior. Propone; las capas deterministas disponen.
Las tres perspectivas -las preguntas, el patrón y este principio final- se reducen a la misma regla:
La fiabilidad consiste en elegir los fracasos que se pueden sobrevivir.
Con los LLM, eso significa manejar el no-determinismo a través de prácticas deterministas:
Los modelos pequeños hacen esto más fácil porque sus fracasos son fuerte. JSON Inválido. Salida truncada. Violaciones del esquema. Estos son regalos - te dicen inmediatamente que algo salió mal.
Las fallas del modelo fronterizo son: silencio. Tonterías plausibles. alucinaciones seguras. deriva semántica que sólo se hace visible cuando un cliente se queja o una auditoría falla.
Voy a tomar los fracasos en voz alta cada vez.
© 2026 Scott Galloway — Unlicense — All content and source code on this site is free to use, copy, modify, and sell.