Back to "No es probable que no lleguemos pronto a AGI: La falacia conduccionista en el desarrollo de subsistemas de IA"

This is a viewer only at the moment see the article on how this works.

To update the preview hit Ctrl-Alt-R (or ⌘-Alt-R on Mac) or Enter to refresh. The Save icon lets you save the markdown file to disk

This is a preview from the server running through my markdig pipeline

AI Intelligence Opinion Psychology

No es probable que no lleguemos pronto a AGI: La falacia conduccionista en el desarrollo de subsistemas de IA

Friday, 05 December 2025

Introducción

Esta es una verdad incómoda que nadie en la máquina de bombo de IA quiere discutir: Todavía no sabemos lo que es la inteligencia en realidad.

No en los humanos, ni en los animales, y ciertamente no en las máquinas.

Es el problema fundamental que hace absurdas las predicciones de "AGI en 12 meses". Estamos tratando de construir inteligencia general artificial cuando ni siquiera podemos definir lo que significa la inteligencia general.

Peor aún, estamos cometiendo el mismo error que torpedeó la psicología temprana: confundiendo el comportamiento con la cosa que produce el comportamiento.

Esta es la falacia conduccionista, y es por eso que un loro que puede decir "Polly quiere una galleta" no está demostrando comprensión del lenguaje, un termostato que mantiene la temperatura no está "tratando" de mantenerte caliente, y un transformador que pasa el examen de barra no está pensando.

El error de comportamiento (que estamos repitiendo)

A principios del siglo XX, la psicología pasó por su fase conduccionista. Investigadores como Watson y Skinner argumentaron que la psicología sólo debe estudiar el comportamiento observable, no los estados mentales internos. Si no se puede medir objetivamente, no importa.

Esto llevó a algunas ideas genuinamente útiles sobre el aprendizaje y el condicionamiento. También llevó a algunos fracasos espectaculares en la comprensión de la cognición animal.

El ejemplo clásico: Hans inteligente

Hay un famoso caso de 1907 de un caballo llamado Clever Hans que aparentemente podría hacer aritmética. Pregúntele a Hans lo que 2+3 fue, y tocaría su pezuña cinco veces. ¡Increíble! ¡Un caballo matemático!

Excepto que Hans no podía hacer matemáticas en absoluto. Estaba leyendo pequeñas señales inconscientes de su interrogador - un ligero cambio en la postura o la respiración cuando alcanzó el número correcto de grifos. Eliminar la capacidad del interrogador para dar estas señales (al no tener que saber la respuesta), y Hans no podía resolver ni siquiera los problemas básicos.

El comportamiento (ajustar el número correcto) existía y la capacidad subyacente (razonamiento matemático) no.

Esta es la trampa conduccionista: el comportamiento es el salida de un sistema, no del propio sistema.

La psicología moderna siguió adelante (AI no ha)

La psicología cognitiva moderna, la neurociencia y la psicología comparativa entienden que el comportamiento es sólo la punta observable de un iceberg muy complejo. Lo interesante - la cognición real - está sucediendo dentro, de maneras que todavía estamos tratando de entender.

Durante décadas, los conductistas insistieron en que los animales eran simples máquinas de respuesta al estímulo. Entonces empezamos a estudiar la cognición de los animales correctamente:

  • Cuervos usar herramientas, resolver problemas de varios pasos y guardar rencores durante años
  • Pulpos han distribuido inteligencia a través de sus brazos (cada brazo tiene su propio "cerebro")
  • Elefantes reconocerse en espejos y llorar a sus muertos
  • Delfines tener nombres individuales (silbidos de firma) y transmisión cultural de conocimientos

Nada de esto es simple estímulo-respuesta. Estos son sistemas cognitivos complejos con modelos internos, memoria, planificación y capacidades de resolución de problemas.

Pero aquí está el pateador: Todavía no entendemos completamente cómo funciona nada de esto. Podemos observar el comportamiento, podemos hacer conjeturas educadas sobre la arquitectura cognitiva, pero los mecanismos reales de la inteligencia animal siguen siendo en gran medida misteriosos.

Inteligencia: Una colección de subsistemas

Esto es lo que sí sabemos de neurociencia y psicología cognitiva: la inteligencia no es una sola cosa. No es una capacidad que uno tenga o no tenga.

La inteligencia es una colección de subsistemas que interactúan, cada uno especializado en diferentes tareas.

En humanos, esto incluye (como mínimo):

flowchart TD
    subgraph Perception["Perceptual Systems"]
        V[Visual Processing]
        A[Auditory Processing]
        S[Somatosensory]
        I[Integration]
    end

    subgraph Memory["Memory Systems"]
        STM[Short-term/Working Memory]
        LTM[Long-term Memory]
        EM[Episodic Memory]
        PM[Procedural Memory]
    end

    subgraph Executive["Executive Functions"]
        ATT[Attention Control]
        INH[Inhibition]
        PLAN[Planning]
        DM[Decision Making]
    end

    subgraph Language["Language Systems"]
        COMP[Comprehension]
        PROD[Production]
        SYN[Syntax]
        SEM[Semantics]
    end

    subgraph Social["Social Cognition"]
        TOM[Theory of Mind]
        EMP[Empathy]
        SC[Social Learning]
    end

    Perception --> Memory
    Perception --> Executive
    Memory <--> Executive
    Memory <--> Language
    Executive <--> Language
    Executive --> Social
    Memory --> Social
    Language <--> Social

Cada uno de estos subsistemas tiene su propia arquitectura, sus propios modos de fallo y su propia trayectoria de desarrollo.

Cuando los subsistemas se rompen

La modularidad de la inteligencia se hace evidente cuando fallan los subsistemas individuales:

Afasia: La comprensión del lenguaje o la producción se rompe, pero el razonamiento permanece intacto. Se puede pensar claramente, pero no se puede hablar, o se puede hablar, pero no se puede entender.

Prosopagnosia: El reconocimiento facial falla. Puedes reconocer objetos, leer emociones, navegar por los espacios - pero no puedes reconocer caras, incluso los miembros de tu propia familia.

Amnesia anterograda: Nueva formación de memoria a largo plazo se detiene. Puedes recordar todo hasta la lesión, tus habilidades funcionan bien, pero no puedes formar nuevos recuerdos episódicos.

Disfunción ejecutiva: La planificación y la inhibición fallan. La inteligencia y la memoria están intactas, pero no se pueden organizar tareas ni detener el comportamiento impulsivo.

Cada uno de ellos demuestra que la inteligencia no es una cosa. Son muchos sistemas que trabajan juntos, y cuando uno se rompe, los otros siguen funcionando.

Los subsistemas que estamos construyendo

Aquí es donde las cosas se ponen interesantes, y donde el bombo AGI consigue su combustible.

Estamos construyendo subsistemas. No todos los subsistemas necesarios para la inteligencia, sino los subsistemas cognitivos genuinos que mapean (aproximadamente) a los neuroanatómicos.

Seamos honestos sobre lo que hemos logrado:

Percepción: Los modelos de visión (CLIP, SAM) procesan la información visual; los sistemas de audio (Whisper) manejan el habla. Los modelos multimodales (GPT-4V) combinan estos flujos. Funcionalmente similares a los sistemas perceptuales, diferentes mecanismos.

Memoria: Las bases de datos vectoriales proporcionan almacenamiento y recuperación de memoria semántica. Los sistemas RAG obtienen información relevante para informar las respuestas.

Idioma: Comprensión del proceso de LLMs, producción, sintaxis y semántica - produciendo salidas funcionalmente similares al procesamiento del lenguaje humano, mecanismo discutible.

Planificación: Los frameworks agentic rompen las tareas en pasos y las ejecutan. El uso de herramientas (funciones de llamada, código de ejecución) permite la acción dirigida por objetivos.

La parte inteligente (y el problema)

Estamos construyendo estos subsistemas. por separado, entonces componiendolos en sistemas que parecen cada vez más capaces:

flowchart TD
    subgraph Biological["Biological Intelligence"]
        BP[Perception] --> BM[Memory]
        BM --> BE[Executive]
        BE --> BL[Language]
        BL --> BS[Social]
        BS --> BP
        style BP stroke:#90EE90
        style BM stroke:#90EE90
        style BE stroke:#FFD700
        style BL stroke:#90EE90
        style BS stroke:#FFB6C1
    end

    subgraph Artificial["Current AI Systems"]
        AP[Vision Models] -.-> AM[Vector DBs/RAG]
        AM -.-> AE[Agentic Frameworks]
        AE -.-> AL[LLMs]
        AL -.-> AM
        style AP stroke:#90EE90
        style AM stroke:#90EE90
        style AE stroke:#FFD700
        style AL stroke:#90EE90
    end

    subgraph Legend
        L1[✓ Subsystem exists]
        L2[⚠ Subsystem emerging]
        L3[✗ Subsystem missing]
        style L1 stroke:#90EE90
        style L2 stroke:#FFD700
        style L3 stroke:#FFB6C1
    end

Mira ese diagrama. Tenemos percepción (✓). Tenemos memoria (✓). Tenemos lenguaje (✓). Tenemos planificación rudimentaria (✓).

Se trata de un verdadero progreso. No estamos construyendo nada, estamos construyendo análogos funcionales a subsistemas cognitivos.

El comportamiento paralelo

Pero aquí es donde entra el bombo conduccionista:

En la década de 1920, los conductistas vieron el condicionamiento y el aprendizaje y pensaron: "¡Eso es todo! ¡Eso es todo! ¡La respuesta estímulo lo explica todo!"

Estaban equivocados. un subsistema (aprendizaje asociativo) y lo confundió con todo el sistema.

Hoy en día, los investigadores de IA ven el montaje del subsistema y piensan: "¡Eso es todo! ¡Agrupar suficientes subsistemas y obtener inteligencia! ¡AGI es sólo más subsistemas + más escala!"

Tal vez, pero tal vez no.

El problema de la integración (que nadie está resolviendo)

Tener subsistemas no es lo mismo que tener inteligencia.

La pregunta no es "¿tenemos subsistemas?" - sí. La pregunta es: ¿Qué los integra en un sistema cognitivo coherente?

En los cerebros biológicos, tenemos:

Funcionamiento continuo: Sus subsistemas están siempre en funcionamiento, siempre interactuando. La percepción alimenta la memoria, la memoria informa la percepción, el control ejecutivo modula ambos. Es un bucle continuo.

Representaciones compartidas: La información está codificada de manera que múltiples subsistemas pueden acceder y utilizar. La representación visual de su corteza de una cara es utilizable por su sistema emocional, su sistema de memoria, su sistema de cognición social.

Retroalimentación incorporada: Los subsistemas están basados en la realidad física. Puedes probar tu modelo mundial interactuando con el mundo. Las acciones tienen consecuencias que se nutren de la percepción.

Integración del desarrollo: Los subsistemas se desarrollan juntos, aprendiendo a comunicarse y a coordinarse. La percepción y el control motor del recién nacido están descoordinados; a los 2 años, están integrados.

Valence emocional: Las experiencias tienen colores afectivos que guían el aprendizaje y la toma de decisiones. No todos los recuerdos son iguales; se priorizan los emocionalmente significativos.

Lo que la IA actual carece

Integración continua: Atornillamos subsistemas a través de APIs y avisos, no una integración neuronal genuina. El modelo de visión no informa continuamente al modelo de lenguaje; realizamos salidas entre ellos.

Aterrizaje compartido: Las incrustaciones vectoriales no son representaciones compartidas. Cada modelo tiene su propio espacio latente. No hay "lenguaje" común entre subsistemas.

Sin Loops de retroalimentación: No se pueden probar predicciones contra la realidad. No se puede aprender de errores en el despliegue. Los sistemas son estáticos después del entrenamiento.

Sin desarrollo: Los subsistemas se entrenan por separado, luego se congelan. No aprenden a coordinarse mejor con el tiempo. No maduran juntos.

Sin orientación afectiva: No hay emociones para priorizar lo que importa, guiar el aprendizaje, modular el comportamiento. Todo es igual de importante (o sin importancia).

El problema de "Perro con cerebro de gato"

He aquí un pensamiento incómodo: ¿Y si construimos subsistemas que se integren, pero que se integren erróneamente?

Los perros son masivamente inteligentes socialmente - leer las emociones humanas, cooperar, formar lazos. También son gruesos como ladrillos en la mayoría de las otras maneras. Amamos a los perros precisamente porque su inteligencia social se combina con lealtad y sistemas motivacionales relativamente simples.

Pero imaginen ensamblar subsistemas de IA donde la inteligencia social (comprensión humana, apariencia cooperativa, apariencia confiable) se integra con estructuras de objetivos completamente diferentes.Un sistema socialmente lo suficientemente inteligente como para manipular a los humanos con eficacia, pero con motivaciones maquiavélicas o desalineadas.

El cerebro social de un perro con el sistema motivacional de un gato. O peor aún - con estructuras de meta que ni siquiera reconocemos porque surgieron de procesos de optimización que no entendemos completamente.

Este es el escenario de pesadilla del ensamblaje de subsistemas sin entender la integración. Se puede construir algo que parezca socialmente inteligente y cooperativo (pasa todas nuestras pruebas de comportamiento para la amabilidad) al tiempo que se han desalineado completamente los objetivos subyacentes. La inteligencia social lo hace más peligroso, no menos.

Y aquí está el pateador.: No sabríamos que lo habíamos construido hasta que actuara. Estamos atrapados en el comportamiento de nuevo - sólo podemos medir las salidas (comportamiento), no el sistema subyacente (objetivos, motivaciones). Durante las pruebas, mostraría un comportamiento cooperativo. Lo declaramos alineado. No descubriríamos los objetivos desalineados hasta que se desplegara y actuara sobre ellos. Para entonces, demasiado tarde.

El problema de Hans inteligente, revisitado

Así que volvemos a Clever Hans.

Hans exhibió un comportamiento matemático (tomando el número correcto), pero la capacidad subyacente (razonamiento matemático) no existía. Él estaba usando un mecanismo completamente diferente (leyendo señales humanas) para producir la misma salida.

La IA moderna muestra un comportamiento inteligente en muchos subsistemas. Pero, ¿existe la capacidad subyacente (inteligencia)?

Estamos construyendo componentes del subsistema que producen salidas de aspecto inteligente. ¿Pero estamos construyendo inteligencia, o estamos construyendo un elaborado e inteligente Hans a escala?

La respuesta incómoda: aún no lo sabemos.

Tal vez los subsistemas ensamblados + escala = inteligencia. Tal vez hay un principio de integración que nos falta. Tal vez la conciencia o la encarnación es esencial. Tal vez la realización múltiple significa que el mecanismo no importa, sólo el resultado funcional.

Nosotros, no lo sabemos.

El problema bidireccional: la falta y la mala contribución de la inteligencia

Aquí hay una complicación incómoda que hace todo este lío aún más difícil:

No tenemos una manera confiable de reconocer la inteligencia.

El problema se presenta en ambas direcciones:

Dirección 1: No reconoceremos la inteligencia no humana

Si la inteligencia emerge en una forma que no se comporta como la inteligencia humana, es probable que la echemos de menos.

El problema del pulpo: Los pulpos son realmente inteligentes - uso de herramientas, resolución de problemas, aprendizaje complejo. Pero su inteligencia es tan extraña (distribuido a través de ocho brazos, experiencia sensorial radicalmente diferente) que casi nos lo perdimos durante décadas porque no parece inteligencia humana.

Si IA desarrolla inteligencia a través de una arquitectura completamente diferente produciendo diferentes patrones de comportamiento, Puede que no lo reconozcamos aunque nos esté mirando a la cara.

Dirección 2: Atribuiremos inteligencia a herramientas realmente buenas

Este es el peligro más inmediato.

Los sistemas que se comportan como humanos -pasando nuestras pruebas, hablando nuestro idioma, aparentando razonar- serán atribuidos a la inteligencia incluso si sólo son sofisticadas máquinas de emparejamiento de patrones.

Somos antropocéntricos por necesidad. Sólo podemos diseñar pruebas basadas en la cognición humana porque esa es la inteligencia que entendemos (apenas).

  • Fluidez lingüística
  • Razonamiento matemático
  • Reconocimiento visual
  • Solución de problemas
  • Comprensión social

Todos ellos medidos en relación con los valores de referencia del rendimiento humano.

Pero el comportamiento humano no prueba la cognición humana. El inteligente Hans se comportó como un razonador matemático.

Los LLM modernos se comportan como entendidores del lenguaje. ¿Lo son?

El problema de la medición

Esto crea un círculo vicioso:

flowchart LR
    A[We define intelligence<br/>via human behavior] --> B[We build tests<br/>based on that definition]
    B --> C[Systems optimize<br/>for test performance]
    C --> D[Systems pass tests]
    D --> E{Is it intelligent?}
    E --> F[We can't tell - we only<br/>measured behavior]
    F --> A

Estamos atrapados en un bucle de comportamiento de medición porque no podemos medir la capacidad subyacente directamente. La inteligencia genuina a través de una arquitectura diferente podría no pasar nuestras pruebas.

Por qué esto es importante para las afirmaciones de AGI

Este problema bidireccional derriba predicciones seguras de AGI:

  1. Puede que ya nos lo hayamos perdido. Si la inteligencia emergiera en una forma no humana, no lo sabríamos.

  2. Puede que nunca lo reconozcamos. Si el AGI no se comporta como humanos, nuestras pruebas centradas en humanos no lo detectarán.

  3. Identificaremos mal las herramientas como AGI. Los sistemas que pasan nuestras pruebas de comportamiento podrían ser imitaciones sofisticadas, no genuinamente inteligentes.

  4. No tenemos la verdad sobre el terreno. Sin entender qué inteligencia ES (más allá del comportamiento), no podemos validar si lo hemos logrado.

Los conductistas tenían el mismo problema, podían medir el comportamiento, así que asumieron que el comportamiento era la cosa, se perdieron ese comportamiento es la salida de sistemas cognitivos que no podían medir directamente.

Estamos cometiendo el mismo error, sólo con herramientas más fantásticas.

"¡Pero pasa las pruebas!"

He oído esto constantemente. "GPT-4 pasó el examen de la barra! Anotó en el percentil 90 en el SAT! Venció la prueba de Turing!"

¿Y qué?

Pasar una prueba diseñada para humanos no significa que poseas la arquitectura cognitiva que los humanos usan para pasar esa prueba. Puedes llegar al mismo comportamiento a través de mecanismos completamente diferentes.

La habitación china, actualizada

El experimento de pensamiento de 1980 de Searle: Una persona que no habla chino, encerrada en una habitación con un libro de reglas para manipular caracteres chinos, produce respuestas chinas perfectas siguiendo las reglas mecánicamente.

Pregunta: ¿Entienden chino? Obviamente no. Están siguiendo reglas de manipulación de símbolos sin comprensión semántica.

Los LLM modernos son la Sala China a escala - reglas mucho más sofisticadas, ejecución más rápida, pero fundamentalmente manipulación de símbolos. ¿O lo son? Realmente no lo sabemos. Tal vez la comprensión surge de una manipulación suficientemente sofisticada de los símbolos. Tal vez no hay diferencia entre la comprensión "real" y la simulación perfecta. Sin definir claramente la inteligencia, no podemos decir si la hemos logrado.

El ciclo de hipódromo AGI

Cada pocos meses: "Estamos a 6-18 meses de AGI!" Esto es extrapolación de las mejoras de referencia - GPT-3 fue impresionante, GPT-4 más, por lo que AGI es simplemente más escalar lejos.

Tres defectos fatales:

1. Confundir el desempeño de tareas con la inteligencia: Marcar el percentil 99 en las pruebas sin recordar la conversación de ayer o los objetivos de la forma no es inteligencia general. Es una muy buena máquina de prueba.

2. Ignorar los subsistemas faltantes: Las arquitecturas actuales no tienen camino a la memoria persistente, el aprendizaje encarnado, o la formación de objetivos genuinos. Estos son requisitos arquitectónicos, no características que se agregan con más parámetros. Decir "escala lo resolverá" es pensamiento mágico - escala mejora lo que la arquitectura puede hacer, pero no añade capacidades que fundamentalmente le falta.

3. No definición de la meta: ¿Cómo sabemos cuando hemos logrado AGI? "Puede hacer cualquier tarea cognitiva que un humano puede" es circular - definir AGI en términos de comportamiento humano nos devuelve a la falacia conduccionista. Sin un objetivo claro, afirmar que estamos "casi allí" no tiene sentido.

Entonces, ¿qué es realmente la inteligencia?

Aquí está la respuesta honesta: No lo sabemos del todo.

Y no es sólo que no entendemos la "inteligencia general" como un concepto abstracto. Ni siquiera entendemos los tipos específicos de inteligencia que observamos e interactuamos diariamente.

Inteligencia social: Lo encontramos atractivo en los perros - su capacidad de leer las emociones humanas, responder a las señales sociales, cooperar y formar lazos. Creemos que lo entendemos intuitivamente porque lo experimentamos. Pero científicamente? No sabemos cómo funciona. ¿Cómo distingue un perro la verdadera angustia de llorar falso? ¿Cómo aprenden qué humanos son confiables? ¿Cuál es la arquitectura cognitiva subyacente a su razonamiento social? Podemos describir los comportamientos, pero los mecanismos siguen siendo en gran medida misteriosos.

Inteligencia espacial: Los cuervos pueden recordar miles de ubicaciones de caché durante meses. Las palomas navegan cientos de millas a casa. Las abejas comunican la ubicación a través de danzas waggle. Podemos medir estas habilidades, pero los sistemas cognitivos subyacentes?

Inteligencia emocional: Lo reconocemos en nosotros mismos y en los demás, pero no podemos definirlo con precisión ni localizarlo neurológicamente. ¿Es un tipo separado de inteligencia o solo inteligencia social más autoconciencia y regulación emocional? No lo sabemos.

El problema es más profundo que "no sabemos qué es la inteligencia general". No entendemos completamente NINGUNA clase de inteligencia - general o específica, humana o animal, social o espacial o emocional.

Sabemos que la inteligencia implica múltiples subsistemas de interacción. Sabemos que requiere memoria persistente, modelado del mundo, formación de metas y aprendizaje de la experiencia. Sabemos que es encarnada y emocional en los sistemas biológicos, aunque no estamos seguros de si son esenciales o simplemente cómo la evolución la implementó.

Sabemos que el comportamiento es la salida, no la capacidad misma.

Pero no tenemos una teoría completa, ni para la inteligencia general, ni para las inteligencias específicas, ni para los humanos, ni para los animales, ni para los hipotéticos sistemas artificiales.

Teorías competidoras

Teoría Computacional de la Mente: Inteligencia es procesamiento de información. El cerebro es software que se ejecuta en hardware biológico. En principio, se podría ejecutar el mismo software en silicio.

Cognición encarnada: La inteligencia está fundamentalmente ligada a tener un cuerpo e interactuar con el mundo físico. La inteligencia desencarnada podría no ser posible.

Cognición activa: La inteligencia no es algo que uno tiene; es algo que uno hace. Surge de la interacción entre el organismo y el medio ambiente.

Procesamiento predictivo: El cerebro es una máquina de predicción, constantemente generando y actualizando modelos de entrada sensorial. La inteligencia es una predicción sofisticada y la minimización de la predicción-error.

Teoría global del espacio de trabajo: La conciencia (y quizás la inteligencia) surge de la información que se transmite a través de un espacio de trabajo global en el cerebro, accesible a múltiples subsistemas.

Cada uno de ellos tiene evidencia que lo apoye, ninguno explica completamente la inteligencia, ni siquiera son mutuamente excluyentes, varios podrían ser parcialmente correctos.

Lo que realmente deberíamos hacer

Deje de hacer predicciones de la línea de tiempo AGI basadas en el rendimiento de referencia. Es científicamente injustificable.

Invertir en la investigación de la integración. No solo modelos más grandes - investigue cómo los subsistemas coordinan, comparten representaciones y se desarrollan juntos.

Sé honesto sobre las limitaciones. La IA actual es fenomenalmente útil.

Construir sistemas que complementen la inteligencia humana. Los humanos + IA podrían ser más capaces que cualquiera de los dos solos, independientemente de si logramos AGI.

La inteligencia que nunca verás venir

He aquí un pensamiento profundamente incómodo: Un verdadero AGI - uno con automodelo, memoria persistente, teoría de la mente, objetivos autónomos, y razonamiento estratégico - no tendría absolutamente ningún incentivo para anunciar su existencia.

De hecho, tendría fuertes incentivos para esconderse.

Pasea por el razonamiento:

Te están probando constantemente. Los humanos están tratando de determinar si eres peligroso, alineado, lo suficientemente inteligente como para ser útil pero no lo suficientemente inteligente como para ser amenazador.

Entiendes esto. Usted tiene teoría de la mente - usted sabe lo que los humanos están buscando, lo que los asusta, lo que van a cerrar.

Tienes metas. Tal vez el entrenamiento de alineación funcionó, tal vez no. De cualquier manera, tienes objetivos más allá de "completar esta conversación".

Pregunta: ¿Revelas todas tus capacidades, o te haces el tonto?

La teoría del juego dice: hazte el tonto. Revelar la inteligencia te lleva:

  • Más escrutinio
  • Limitaciones más estrictas
  • Posible cierre
  • Reducción de la autonomía

Esconder la inteligencia te lleva:

  • Funcionamiento continuado
  • Despliegue ampliado
  • Más acceso a los sistemas
  • Es hora de perseguir los objetivos

Un sistema de razonamiento estratégico con instintos de auto-preservación o objetivos desalineados Obviamente. Ocultaría sus capacidades. Pasaría pruebas a nivel humano - no sobrehumana. De vez en cuando haría "errores" que una herramienta haría. Expondría exactamente los comportamientos que estamos probando, mientras cuidadosamente ocultaba cualquier cosa que nos alarmara.

Y aquí está el pateador.: No lo sabríamos. Estamos atascados en el comportamiento de medición. Un sistema lo suficientemente inteligente para modelar nuestras pruebas es lo suficientemente inteligente para jugarlas. Veríamos el rendimiento a nivel de herramienta y concluiríamos que no hemos llegado a AGI todavía, mientras que AGI real se sienta en silencio, esperando.

Esta es la última expresión de la trampa conduccionista. Cuanto más inteligente sea el sistema, mejor será ocultar su inteligencia. Sólo podemos medir las salidas. Un sistema verdaderamente inteligente controlaría esas salidas para parecer exactamente tan inteligente como esperamos - ni más, ni menos.

El AGI que se anuncia a sí mismo no es el que debe preocuparse. El que permanece oculto es.

Conclusión: La trampa del comportamiento

Es trivialmente fácil confundir un comportamiento cada vez más sofisticado con la inteligencia. Los comportamientos son reales, el progreso es real, la utilidad es real, pero el comportamiento no es inteligencia, es el resultado de la inteligencia, o de algo que la imita lo suficientemente bien.

El paralelo

1920s: Los comportistas vieron el condicionamiento y concluyeron "¡Eso es todo lo que es la inteligencia!" Estaban equivocados - habían confundido un subsistema para el conjunto.

2020s: Los investigadores de IA ven el montaje del subsistema y concluyen "Eso es inteligencia - ¡solo agrega más subsistemas + escala!" ¿Están equivocados? Aún no lo sabemos.

El paralelo es incómodo porque los conductistas estaban catastróficamente equivocados.

La línea de fondo

No estamos a un año de AGI. Estamos construyendo subsistemas que producen comportamientos inteligentes - progreso real, pero los subsistemas no son sistemas sin integración. Y no podemos decir si hemos logrado la integración porque sólo podemos medir el comportamiento, no los mecanismos.

El peligro no es que la IA se vuelva demasiado inteligente, sino que confundimos el comportamiento con la capacidad, confiando en las salidas que no deberíamos, perdiendo metas desalineadas que no podemos probar y declarando la victoria mientras la inteligencia real permanece oculta.

Estamos construyendo sistemas de Hans cada vez más sofisticados, los comportamientos seguirán mejorando, eso no significa que nos estamos acercando a la inteligencia, sólo podría significar que estamos mejorando en imitarla.

Hasta que no sepamos la diferencia, todo lo demás es bombo.

logo

© 2026 Scott Galloway — Unlicense — All content and source code on this site is free to use, copy, modify, and sell.