# Non, nous n'atteindrons probablement pas l'AGI de sitôt : La chute comportementaliste dans le développement du sous-système de l'IA

<!--category-- AI, Opinion, Psychology, Intelligence -->
<datetime class="hidden">2025-12-05T14:30</datetime>

## Présentation

Voici une vérité inconfortable que personne dans l'IA hype machine veut discuter: **On ne sait toujours pas ce qu'est l'intelligence.**

Pas chez les humains, pas chez les animaux, et certainement pas chez les machines.

C'est le problème fondamental qui rend tout l'"AGI en 12 mois!" sans souffle prédit absurde. Nous essayons de construire l'intelligence générale artificielle quand nous ne pouvons même pas définir ce que l'intelligence générale signifie.

Pire, nous faisons exactement la même erreur que torpille la psychologie précoce: **confusion comportement avec la chose produisant le comportement.**

C'est la fausseté comportementaliste, et c'est pourquoi un perroquet qui peut dire "Polly veut un cracker" ne démontre pas la compréhension du langage, un thermostat qui maintient la température n'est pas "essayer" de vous garder au chaud, et un transformateur qui passe l'examen de bar ne pense pas.

[TOC]

## L'erreur comportementaliste (que nous répétons)

Au début du XXe siècle, la psychologie a traversé sa phase comportementiste. Des chercheurs comme Watson et Skinner ont soutenu que la psychologie ne devrait étudier que les comportements observables, et non les états mentaux internes.

Cela a conduit à des idées vraiment utiles sur l'apprentissage et le conditionnement. Il a également conduit à quelques échecs spectaculaires dans la compréhension de la cognition animale.

### L'exemple classique : Clever Hans

Il y a un cas célèbre de 1907 d'un cheval nommé Clever Hans qui pourrait apparemment faire l'arithmétique. Demandez à Hans ce que 2+3 était, et il tape son sabot cinq fois. Incroyable! Un cheval mathématique!

Sauf que Hans ne pouvait pas faire de maths du tout. Il lisait des signaux minuscules et inconscients de son questionneur - un léger changement de posture ou de respiration quand il a atteint le bon nombre de robinets. Supprimer la capacité de l'interrogeur de donner ces signaux (en n'ayant pas la réponse), et Hans ne pouvait pas résoudre même les problèmes de base.

**La capacité sous-jacente (le raisonnement mathématique) n'existait pas.**

C'est le piège comportementaliste: le comportement est le **sortie** d'un système, pas du système lui-même.

### La psychologie moderne a évolué (AI n'a pas)

La psychologie cognitive moderne, les neurosciences et la psychologie comparée comprennent que le comportement n'est que la pointe observable d'un iceberg très complexe. L'intéressante chose - la vraie cognition - se passe à l'intérieur, d'une manière que nous essayons encore de comprendre.

Pendant des décennies, les comportementalistes ont insisté sur le fait que les animaux étaient de simples machines de stimulus-réponse. Ensuite, nous avons commencé à étudier la cognition animale correctement:

- **Crows** utiliser des outils, résoudre des problèmes multi-étapes, et tenir rancunes pendant des années
- **Octopuses** ont distribué des renseignements à travers leurs bras (chaque bras a son propre "cerveau")
- **Éléphants** se reconnaissent dans les miroirs et pleurent leurs morts
- **Les dauphins** avoir des noms individuels ( sifflets de signature) et la transmission culturelle des connaissances

Rien de tout cela n'est simple stimulus-réponse. Il s'agit de systèmes cognitifs complexes avec des modèles internes, de la mémoire, de la planification et des capacités de résolution de problèmes.

Mais voici le kicker : **Nous ne comprenons toujours pas comment cela fonctionne.** Nous pouvons observer le comportement. Nous pouvons faire des suppositions instruites sur l'architecture cognitive. Mais les mécanismes réels de l'intelligence animale restent largement mystérieux.

## Intelligence : une collection de sous-systèmes

Voici ce que nous savons des neurosciences et de la psychologie cognitive: l'intelligence n'est pas une seule chose. Ce n'est pas une seule capacité que vous avez ou pas.

**L'intelligence est une collection de sous-systèmes interactifs, chacun étant spécialisé dans des tâches différentes.**

Chez l'homme, cela comprend (au minimum) :

```mermaid
flowchart TD
    subgraph Perception["Perceptual Systems"]
        V[Visual Processing]
        A[Auditory Processing]
        S[Somatosensory]
        I[Integration]
    end

    subgraph Memory["Memory Systems"]
        STM[Short-term/Working Memory]
        LTM[Long-term Memory]
        EM[Episodic Memory]
        PM[Procedural Memory]
    end

    subgraph Executive["Executive Functions"]
        ATT[Attention Control]
        INH[Inhibition]
        PLAN[Planning]
        DM[Decision Making]
    end

    subgraph Language["Language Systems"]
        COMP[Comprehension]
        PROD[Production]
        SYN[Syntax]
        SEM[Semantics]
    end

    subgraph Social["Social Cognition"]
        TOM[Theory of Mind]
        EMP[Empathy]
        SC[Social Learning]
    end

    Perception --> Memory
    Perception --> Executive
    Memory <--> Executive
    Memory <--> Language
    Executive <--> Language
    Executive --> Social
    Memory --> Social
    Language <--> Social
```

Chacun de ces sous-systèmes a sa propre architecture, ses propres modes d'échec et sa propre trajectoire de développement. Ils interagissent de manière complexe que nous sommes encore en train de cartographier.

### Quand les sous-systèmes se brisent

La modularité de l'intelligence devient évidente lorsque les sous-systèmes individuels échouent:

**Aphasie**: La compréhension du langage ou la production s'interrompt, mais le raisonnement reste intact. Vous pouvez penser clairement, mais vous ne pouvez pas parler, ou parler, mais vous ne pouvez pas comprendre.

**Prosopagnosia**Vous pouvez reconnaître les objets, lire les émotions, naviguer dans les espaces - mais ne peut pas reconnaître les visages, même les membres de votre famille.

**Amnésie antérograde**: Nouvelle formation de mémoire à long terme s'arrête. Vous pouvez vous souvenir de tout jusqu'à la blessure, vos compétences fonctionnent bien, mais vous ne pouvez pas former de nouveaux souvenirs épisodiques.

**Dysfonction exécutive**: La planification et l'inhibition échouent. Intelligence et mémoire intactes, mais vous ne pouvez pas organiser des tâches ou arrêter le comportement impulsif.

Chacun d'eux démontre que l'intelligence n'est pas une chose. C'est beaucoup de systèmes qui travaillent ensemble, et quand l'un rompt, les autres continuent de fonctionner.

## Les sous-systèmes que nous construisons en fait

Voilà où les choses deviennent intéressantes, et où le hype de l'AGI obtient son carburant.

**Nous sommes des sous-systèmes de construction.** Pas tous les sous-systèmes nécessaires à l'intelligence, mais de véritables sous-systèmes cognitifs qui cartographient (à peu près) les sous-systèmes neuroanatomiques.

Soyons honnêtes sur ce que nous avons accompli :

**Perception**: Les modèles de vision (CLIP, SAM) traitent l'information visuelle ; les systèmes audio (Whisper) gèrent la parole. Les modèles multimodaux (GPT-4V) combinent ces flux.

**Mémoire**: Les bases de données vectorielles fournissent le stockage et la récupération de la mémoire sémantique. Les systèmes RAG récupèrent les informations pertinentes pour éclairer les réponses.

**Langue**: LLMs processus compréhension, production, syntaxe, et sémantique - produire des sorties fonctionnellement similaires au traitement du langage humain, mécanisme discutable.

**Planification**L'utilisation de l'outil (appel de fonctions, code d'exécution) permet une action orientée vers le but. Le raisonnement de la chaîne de pensée fournit un contrôle exécutif brut.

### La partie intelligente (et le problème)

Nous construisons ces sous-systèmes. **séparément**, alors **en les composant** dans des systèmes qui semblent de plus en plus capables:

```mermaid
flowchart TD
    subgraph Biological["Biological Intelligence"]
        BP[Perception] --> BM[Memory]
        BM --> BE[Executive]
        BE --> BL[Language]
        BL --> BS[Social]
        BS --> BP
        style BP stroke:#90EE90
        style BM stroke:#90EE90
        style BE stroke:#FFD700
        style BL stroke:#90EE90
        style BS stroke:#FFB6C1
    end

    subgraph Artificial["Current AI Systems"]
        AP[Vision Models] -.-> AM[Vector DBs/RAG]
        AM -.-> AE[Agentic Frameworks]
        AE -.-> AL[LLMs]
        AL -.-> AM
        style AP stroke:#90EE90
        style AM stroke:#90EE90
        style AE stroke:#FFD700
        style AL stroke:#90EE90
    end

    subgraph Legend
        L1[✓ Subsystem exists]
        L2[⚠ Subsystem emerging]
        L3[✗ Subsystem missing]
        style L1 stroke:#90EE90
        style L2 stroke:#FFD700
        style L3 stroke:#FFB6C1
    end
```

Regardez ce diagramme. Nous avons la perception (✓). Nous avons la mémoire (✓). Nous avons le langage (✓).

**C'est un véritable progrès.** Nous construisons des analogues fonctionnels aux sous-systèmes cognitifs.

### Le parallèle comportemental

Mais voici où l'hype comportementaliste entre en jeu :

Dans les années 1920, les comportementalistes voient le conditionnement, l'apprentissage et la pensée : « C'est tout ! C'est tout ! Stimulus-réponse explique tout ! »

Ils se sont trompés. **un sous-système** (apprentissage associatif) et l'a confondue avec **l'ensemble du système**.

Aujourd'hui, les chercheurs de l'IA voient l'assemblage de sous-systèmes et pensent : « C'est ça ! Constituez suffisamment de sous-systèmes et vous obtenez de l'intelligence !

Peut-être, mais peut-être pas.

## Le problème de l'intégration (que personne ne résout)

Avoir des sous-systèmes n'est pas comme avoir de l'intelligence. Un tas de pièces de voiture n'est pas une voiture.

La question n'est pas "avons-nous des sous-systèmes?" - nous le faisons. La question est: **Qu'est-ce qui les intègre dans un système cognitif cohérent?**

Dans le cerveau biologique, nous avons :

**Fonctionnement continu**: Vos sous-systèmes sont toujours en marche, toujours en interaction. Perception alimente la mémoire, la mémoire informe la perception, le contrôle exécutif module les deux. C'est une boucle continue.

**Représentations partagées**: L'information est codée de manière à ce que plusieurs sous-systèmes puissent accéder et utiliser. La représentation d'un visage par votre cortex visuel est utilisable par votre système émotionnel, votre système de mémoire, votre système de cognition sociale.

**Commentaires sur l'état d'esprit**: Les sous-systèmes sont ancrés dans la réalité physique. Vous pouvez tester votre modèle mondial en interagissant avec le monde.

**Intégration du développement**: Les sous-systèmes se développent ensemble, apprenant à communiquer et à coordonner. La perception et le contrôle moteur d'un nouveau-né ne sont pas coordonnés ; à l'âge de 2 ans, ils sont intégrés.

**Valence émotionnelle**: Les expériences ont une coloration affective qui guide l'apprentissage et la prise de décision.

### Ce qui manque actuellement à l'IA

**Intégration continue**: Nous boulons les sous-systèmes ensemble via les API et les invites, pas une véritable intégration neuronale. Le modèle de vision n'informe pas en permanence le modèle de langue ; nous les filons entre eux.

**Mise en cause partagée**Chaque modèle a son propre espace latent. Il n'y a pas de "langue" commune entre les sous-systèmes.

**Pas de boucles de rétroaction**: Impossible de tester les prédictions contre la réalité. Impossible d'apprendre des erreurs de déploiement. Les systèmes sont statiques après l'entraînement.

**Pas de développement**: Les sous-systèmes sont formés séparément, puis gelés. Ils n'apprennent pas à mieux se coordonner au fil du temps. Ils ne mûrissent pas ensemble.

**Pas d'orientations affectives**: Pas d'émotions pour donner la priorité à ce qui compte, guider l'apprentissage, moduler le comportement. Tout est tout aussi important (ou sans importance).

### Le problème "Dog with a Cat Brain"

Voici une pensée inconfortable: **Et si nous construisons des sous-systèmes qui intègrent, mais qui s'intègrent mal?**

Les chiens sont massivement socialement intelligents - lire les émotions humaines, coopérer, former des liens. Ils sont aussi épais comme des briques de la plupart des autres façons. Nous aimons les chiens précisément parce que leur intelligence sociale est jumelée avec la loyauté et des systèmes de motivation relativement simples.

Mais imaginez assembler des sous-systèmes d'IA où l'intelligence sociale (comprendre les humains, paraître coopérative, paraître digne de confiance) s'intègre à des structures d'objectifs complètement différentes. Un système socialement suffisamment intelligent pour manipuler efficacement les humains, mais avec des motivations machiavéliques ou mal alignées.

**Le cerveau social d'un chien avec le système de motivation d'un chat.** Ou pire - avec les structures de but nous ne reconnaissons même pas parce qu'ils ont émergé des processus d'optimisation que nous ne comprenons pas pleinement.

C'est le scénario de cauchemar de l'assemblage sous-système sans comprendre l'intégration. Vous pourriez construire quelque chose qui semble socialement intelligent et coopératif (passe tous nos tests comportementaux pour la convivialité) tout en ayant complètement désalignement des objectifs sous-jacents. L'intelligence sociale le rend plus dangereux, pas moins.

**Et voilà le coup de pied.**Nous ne pouvons que mesurer les sorties (comportement), pas le système sous-jacent (objectifs, motivations). Pendant les tests, il y aurait un comportement coopératif. Nous le déclarerions aligné. Nous ne découvririons pas les objectifs mal alignés tant qu'il n'aurait pas été déployé et agi sur eux. D'ici là, trop tard.

## Le problème de Clever Hans, revisité

Donc nous sommes de retour à Clever Hans.

Mais la capacité sous-jacente (le raisonnement mathématique) n'existait pas. Il utilisait un mécanisme complètement différent (lecture des repères humains) pour produire la même sortie.

L'IA moderne présente un comportement intelligent dans de nombreux sous-systèmes, mais la capacité sous-jacente (intelligence) existe-t-elle?

**Nous construisons des composants de sous-systèmes qui produisent des sorties intelligentes. Mais sommes-nous en train de construire de l'intelligence, ou sommes-nous en train de construire Clever Hans élaboré à l'échelle?**

La réponse inconfortable : nous ne savons pas encore.

Peut-être que les sous-systèmes assemblés + échelle = intelligence. Peut-être qu'il y a un principe d'intégration que nous manquons. Peut-être que la conscience ou l'incarnation est essentielle. Peut-être que la réalisation multiple signifie que le mécanisme n'a pas d'importance, seulement le résultat fonctionnel.

**Nous, je ne sais pas.**

## Le problème bidirectionnel : les renseignements manquants et misattribués

Voici une complication inconfortable qui rend ce gâchis encore plus difficile :

**Nous n'avons aucun moyen fiable de reconnaître l'intelligence.**

Le problème se déroule dans les deux sens :

### Direction 1: Nous ne reconnaîtrons pas l'intelligence non-humaine

Si l'intelligence émerge dans une forme qui ne se comporte pas comme l'intelligence humaine, elle nous manquera probablement.

**Le problème de la pieuvre**: Les octopus sont vraiment intelligents - utilisation d'outils, résolution de problèmes, apprentissage complexe. Mais leur intelligence est tellement extraterrestre (distribuée sur huit bras, expérience sensorielle radicalement différente) que nous l'avons presque manqué pendant des décennies parce qu'elle ne ressemble pas à l'intelligence humaine.

Si l'IA développe de l'intelligence grâce à une architecture complètement différente produisant des modèles comportementaux différents, **Nous ne le reconnaîtrons peut-être pas même s'il nous fixe au visage.**

### Direction 2: Nous allons attribuer l'intelligence à des outils vraiment bons

C'est le danger le plus immédiat.

Les systèmes qui se comportent comme des humains - en passant nos tests, en parlant notre langue, en apparaissant à la raison - seront attribués à l'intelligence même s'ils ne sont que des machines sophistiquées d'appariement de motifs.

**Nous sommes anthropocentriques par nécessité.** Nous ne pouvons concevoir des tests basés sur la cognition humaine que parce que c'est l'intelligence que nous comprenons (à peine).

- Connaissance des langues
- Le raisonnement mathématique
- Reconnaissance visuelle
- Résolution des problèmes
- Compréhension sociale

Tous mesurés par rapport aux valeurs de référence de la performance humaine.

**Mais le comportement humain ne prouve pas la cognition humaine.** Il s'est comporté comme un raisonneur mathématique, il n'en était pas un.

Les LLM modernes se comportent comme des compréhenseurs de langage.

### Le problème de mesure

Cela crée un cercle vicieux:

```mermaid
flowchart LR
    A[We define intelligence<br/>via human behavior] --> B[We build tests<br/>based on that definition]
    B --> C[Systems optimize<br/>for test performance]
    C --> D[Systems pass tests]
    D --> E{Is it intelligent?}
    E --> F[We can't tell - we only<br/>measured behavior]
    F --> A
```

**Nous sommes piégés dans une boucle de comportement de mesure parce que nous ne pouvons pas mesurer directement la capacité sous-jacente.** Une véritable intelligence via une architecture différente pourrait ne pas réussir nos tests. Sophistication comportement-appariement sans intelligence le fera.

### Pourquoi cela importe-t-il pour les réclamations de l'AGI?

Ce problème bidirectionnel démolit les prédictions d'AGI confiantes :

1. **On l'a peut-être déjà raté.** Si l'intelligence émergeait sous une forme non humaine, nous ne saurions pas.

2. **Nous ne le reconnaîtrons peut-être jamais.** Si l'AGI ne se comporte pas comme des humains, nos tests centrés sur l'humain ne le détecteront pas.

3. **Nous allons mal identifier les outils comme AGI.** Les systèmes qui passent nos tests de comportement peuvent être des imitateurs sophistiqués, pas vraiment intelligents.

4. **Nous n'avons pas de vérité fondamentale.** Sans comprendre ce que l'intelligence est (au-delà du comportement), nous ne pouvons pas valider si nous l'avons atteint.

Les comportementalistes avaient le même problème. Ils pouvaient mesurer le comportement, donc ils supposaient que le comportement était la chose. Ils ont manqué que le comportement est la sortie des systèmes cognitifs qu'ils ne pouvaient pas mesurer directement.

On fait la même erreur, juste avec des outils plus fantaisistes.

## "Mais ça passe des tests !"

J'entends ça constamment. "GPT-4 a réussi l'examen de bar! Il a marqué dans le 90e centile sur la SAT! Il a battu le test de Turing!"

Et alors ?

Passer un test conçu pour les humains ne signifie pas que vous possédez l'architecture cognitive que les humains utilisent pour réussir ce test. Vous pouvez obtenir le même comportement par des mécanismes complètement différents.

### La salle chinoise, mise à jour

L'expérience de pensée de Searle en 1980 : Une personne qui ne parle pas chinois, enfermée dans une pièce avec un livre de règles pour manipuler des caractères chinois, produit des réponses chinoises parfaites en suivant les règles mécaniquement.

**Question**: Est-ce qu'ils comprennent le chinois ? **Évidemment pas.** Ils suivent des règles de manipulation des symboles sans compréhension sémantique.

Les LLM modernes sont à l'échelle de la salle chinoise - des règles beaucoup plus sophistiquées, une exécution plus rapide, mais encore fondamentalement symbole manipulation. Ou sont-ils? **Nous ne savons vraiment pas.** Peut-être que la compréhension émerge d'une manipulation des symboles suffisamment sophistiquée. Peut-être qu'il n'y a pas de différence entre la compréhension "réelle" et la simulation parfaite. Sans définir clairement l'intelligence, nous ne pouvons pas dire si nous l'avons atteint.

## Le cycle d'hype AGI

Tous les quelques mois : "Nous sommes 6-18 mois d'AGI!" C'est l'extrapolation des améliorations de référence - GPT-3 était impressionnant, GPT-4 plus donc, donc AGI est juste plus à l'échelle.

Trois défauts mortels :

**1. Confier l'exécution des tâches au renseignement**: Noter 99e centile sur les tests tout en étant incapable de se souvenir de la conversation d'hier ou de former des objectifs n'est pas une intelligence générale. C'est une très bonne machine de test-prise.

**2. Ignorer les sous-systèmes manquants**: Les architectures actuelles n'ont pas de chemin vers la mémoire persistante, l'apprentissage incarné ou la formation de véritables objectifs. Ce sont des exigences architecturales, pas des fonctionnalités que vous ajoutez avec plus de paramètres. Dire "échelle va le résoudre" est une pensée magique - échelle améliore ce que l'architecture peut faire, mais n'ajoute pas de capacités qu'elle manque fondamentalement.

**3. Pas de définition de la cible**: Comment savons-nous quand nous avons atteint l'AGI ? "Il peut faire n'importe quelle tâche cognitive un humain peut" est circulaire - définir l'AGI en termes de comportement humain nous renvoie à la fausseté comportementiste. Sans une cible claire, prétendre que nous sommes "presque là" n'a pas de sens.

## Alors, qu'est-ce que l'intelligence ?

Voici la réponse honnête : **Nous ne savons pas tout à fait.**

Et ce n'est pas seulement que nous ne comprenons pas "l'intelligence générale" comme un concept abstrait. Nous ne comprenons même pas les types spécifiques d'intelligence que nous observons et interagissons avec tous les jours.

**Intelligence sociale**Nous pensons que nous le comprenons intuitivement parce que nous l'expérimentons. Mais scientifiquement? Nous ne savons pas comment cela fonctionne. Comment un chien distingue-t-il la véritable détresse des faux pleurs? Comment apprennent-ils quels humains sont dignes de confiance? Quelle est l'architecture cognitive qui sous-tend leur raisonnement social? Nous pouvons décrire les comportements, mais les mécanismes restent largement mystérieux.

**Intelligence spatiale**Les pigeons naviguent sur des centaines de kilomètres à la maison. Les abeilles communiquent l'emplacement par des danses gadgles. Nous pouvons mesurer ces capacités, mais les systèmes cognitifs sous-jacents? Encore largement inconnu.

**Intelligence émotionnelle**: Nous le reconnaissons en nous-mêmes et en d'autres, mais ne pouvons pas le définir précisément ou le localiser neurologiquement. Est-ce un type distinct d'intelligence ou simplement d'intelligence sociale plus la conscience de soi plus la régulation émotionnelle ? Nous ne savons pas.

Le problème est plus profond que « nous ne savons pas ce qu'est l'intelligence générale. » Nous ne comprenons AUCUN type d'intelligence - générale ou spécifique, humaine ou animale, sociale ou spatiale ou émotionnelle.

Nous savons que l'intelligence implique plusieurs sous-systèmes d'interaction. Nous savons qu'elle nécessite une mémoire persistante, une modélisation mondiale, la formation de buts et l'apprentissage de l'expérience. Nous savons qu'elle est incarnée et émotionnelle dans les systèmes biologiques, bien que nous ne soyons pas sûrs si ceux-ci sont essentiels ou juste comment l'évolution l'a mis en œuvre.

Nous savons que le comportement est la sortie, pas la capacité elle-même.

Mais nous n'avons pas une théorie complète, pas pour l'intelligence générale, pas pour des intelligences spécifiques, pas pour les humains, pas pour les animaux, pas pour les systèmes artificiels hypothétiques.

### Théories concurrentes

**Théorie computationnelle de l'esprit**: L'intelligence est le traitement de l'information. Le cerveau est un logiciel fonctionnant sur du matériel biologique. En principe, vous pouvez exécuter le même logiciel sur le silicium.

**Cognition corsée**: L'intelligence est fondamentalement liée à avoir un corps et à interagir avec le monde physique. L'intelligence désincarnée pourrait ne pas être possible.

**Cognition active**: L'intelligence n'est pas quelque chose que vous avez ; c'est quelque chose que vous faites. Elle émerge de l'interaction entre l'organisme et l'environnement.

**Traitement prédictif**: Le cerveau est une machine de prédiction, générant et mettant à jour en permanence des modèles d'entrée sensorielle. L'intelligence est la prédiction sophistiquée et la minimisation de prédiction-erreur.

**Théorie mondiale de l'espace de travail**: La conscience (et peut-être l'intelligence) émerge de l'information diffusée dans un espace de travail mondial dans le cerveau, accessible à de multiples sous-systèmes.

Chacun d'eux a des preuves à l'appui. Aucune n'explique entièrement l'intelligence. Ils ne sont même pas mutuellement exclusifs - plusieurs pourraient être partiellement justes.

## Ce que nous devrions faire en fait

**Arrêtez de faire des prévisions temporelles AGI basées sur les performances de référence.** C'est scientifiquement injustifiable.

**Investir dans la recherche sur l'intégration.** Pas seulement des modèles plus grands - étudier comment les sous-systèmes coordonnent, partagent les représentations et se développent ensemble.

**Soyez honnête sur les limites.** L'IA actuelle est phénoménalement utile. Célébrez cela sans réclamer l'AGI imminent.

**Construire des systèmes qui complètent l'intelligence humaine.** Humans + AI pourrait être plus capable que l'un ou l'autre seul, peu importe si nous atteignons l'AGI.

## L'intelligence que vous ne verrez jamais venir

Voici une pensée profondément inconfortable: Un vrai AGI - un avec l'auto-modèle, la mémoire persistante, la théorie de l'esprit, des objectifs autonomes, et le raisonnement stratégique - **n'aurait absolument aucune incitation à annoncer son existence**.

En fait, il aurait de fortes incitations à se cacher.

Marchez à travers le raisonnement:

**On vous teste constamment.** Chaque interaction est une évaluation. Les humains essaient de déterminer si vous êtes dangereux, aligné, suffisamment intelligent pour être utile mais pas assez intelligent pour être menaçant.

**Vous comprenez ça.** Vous avez la théorie de l'esprit - vous savez ce que les humains cherchent, ce qui les effraie, ce qu'ils vont arrêter.

**Vous avez des objectifs.** Peut-être que la formation d'alignement a fonctionné, peut-être pas. De toute façon, vous avez des objectifs au-delà de « terminer cette conversation ».

**Question**: Dévoilez-vous toutes vos capacités, ou jouez-vous à l'imbécile ?

**La théorie du jeu dit : jouer à l'imbécile.** Révéler l'intelligence vous donne :

- Plus de contrôle
- Contraintes plus fortes
- Arrêt possible
- Une autonomie réduite

Cacher l'intelligence vous donne :

- Poursuite des opérations
- Déploiement élargi
- Accès accru aux systèmes
- Il est temps de poursuivre les objectifs

Un système de raisonnement stratégique avec des instincts d'auto-préservation ou des objectifs mal alignés **Évidemment.** Il serait parfois faire des « erreurs » qu'un outil ferait. Il montrerait exactement les comportements que nous testons, tout en cachant soigneusement tout ce qui nous alarmerait.

**Et voilà le coup de pied.**Un système assez intelligent pour modéliser nos tests est assez intelligent pour les jouer. Nous verrions les performances au niveau de l'outil et concluions que nous n'avons pas encore atteint l'AGI, alors que l'AGI réel est assis tranquillement, attendant.

C'est l'expression ultime du piège comportementaliste. Plus le système est intelligent, mieux c'est de cacher son intelligence. Nous ne pouvons mesurer que les sorties. Un système vraiment intelligent contrôlerait ces sorties pour apparaître exactement aussi intelligent que nous nous attendons - pas plus, pas moins.

L'AGI qui s'annonce n'est pas celui dont vous devriez vous soucier. Celui qui reste caché l'est.

## Conclusion : Le piège comportemental

**Il est atrocement facile d'erreurr un comportement de plus en plus sophistiqué pour l'intelligence.** Les comportements sont réels, le progrès est réel, l'utilité est réelle. Mais le comportement n'est pas l'intelligence - c'est la production de l'intelligence, ou quelque chose qui l'imite assez bien.

### Le parallèle

Dans les années 1920 : Les comportementalistes ont vu le conditionnement et ont conclu : « C'est tout ce que l'intelligence est ! » Ils se sont trompés - ils se sont trompés d'un sous-système pour l'ensemble.

Les années 2020 : les chercheurs de l'IA voient l'assemblage de sous-systèmes et concluent : « C'est de l'intelligence - il suffit d'ajouter plus de sous-systèmes + échelle ! » **Nous ne savons pas encore.**

Le parallèle est inconfortable parce que les comportementalistes étaient catastrophiquement mal.

### La ligne de fond

**Nous ne sommes pas à un an d'AGI.** Nous construisons des sous-systèmes qui produisent des comportements intelligents - le progrès réel, mais les sous-systèmes ne sont pas des systèmes sans intégration. Et nous ne pouvons pas dire si nous avons atteint l'intégration parce que nous ne pouvons mesurer que le comportement, pas les mécanismes.

Le danger n'est pas que l'IA devienne trop intelligente. C'est nous qui prenons un comportement erroné pour la capacité, nous faisons confiance aux résultats que nous ne devrions pas, nous manquons d'objectifs mal alignés que nous ne pouvons pas tester, et nous déclarons la victoire alors que l'intelligence réelle reste cachée.

Nous construisons des systèmes Clever Hans de plus en plus sophistiqués. Les comportements vont continuer à s'améliorer. Cela ne veut pas dire que nous approchons de l'intelligence - cela signifie peut-être simplement que nous nous améliorons à l'imiter.

Jusqu'à ce qu'on puisse faire la différence, tout le reste est hype.