1. Introduction et problème
Dans la tranche de 3 à 6 ans —jardin d'enfants, préscolaire, CENDI, école infantile— s'est installé un paquet d'artefacts qui prétendent valoir comme soutien à la théorie de l'esprit (ToM) et à la prise de perspective: un détecteur/CNN/système multimodal qui note ToM, perspective-taking score, false-belief accuracy, mindreading index, mentalizing level ou ToM developmental age; un GenAI de ToM worksheets, perspective scripts, false-belief lesson packs ou empathy-ToM cards par prompt; un dashboard de ToM trials/heure ou de perspective compliance; une VR/app/robot comme traitement fermé qui «entraîne la ToM»; et un classement de ToM developmental level par regard, proxémie, émotion ou langage sans médiation. Les artefacts permettent d'exhiber que le centre «fait déjà de la ToM avec l'IA». Le saut —du score, du script, du comptage, du VR-traitement ou du classement à l'affirmation d'un soutien— n'est pas autorisé par les cartographies de l'IA en ECE ni par la pédagogie lorsqu'il y a des décalages réels de voir/savoir et de croyance, un étayage qui nomme des états mentaux, un langage mentaliste, un jeu de rôles qui exige de se mettre à la place de l'autre, et une interprétation pédagogique, non un «ToM-score».
La thèse est restrictive: ces artefacts ne constituent pas un soutien au développement de la théorie de l'esprit / prise de perspective dans la petite enfance. En éducation initiale, cette pratique se développe avec des décalages réels de perspective, une co-présence adulte qui interprète le voir/savoir et la croyance d'autrui, un langage mentaliste et l'agentivité des enfants pour attribuer un état mental distinct du leur (OECD, 2021); non un détecteur d'esprit, un GenAI de worksheets, un dashboard de trials, un VR-traitement fermé ni un classement de ToM developmental level. L'IA peut soutenir la préparation de l'adulte de façon subordonnée; non substituer la relation ni convertir l'enfant en vecteur de ToM-score. Wang, Wang, Qin, Wu y Wu (2026) apportent Social Story sur la prise de perspective cognitive et affective à 4–5 ans: pratique médiée, non score ni recette GenAI. Liang, Sun, Xu, Lee y Siu (2026) situent la prise de perspective visuelle (VPT): base de voir/savoir, non dashboard. Mulvihill, Armstrong, Casey, Redshaw, Scarinci y Slaughter (2023) examinent le langage mentaliste des éducatrices: métier de MSL, non mindreading index. Heise y Bowman (2025) proposent le CAT pour 3–8 ans: mesure, non pédagogie. Süngü y Alıcı (2025), Witt, Seehagen y Zmyj (2022) et Tuglaci e Ilgaz (2025) montrent que le rendement en fausse croyance dépend de l'objet, de l'appartenance et d'éléments fantastiques: constat de tâche, non autorisation de false-belief accuracy comme évaluation. Bhavna, Akhter, Banerjee y Roy (2024) —transfert: 3–12 ans et adultes; fMRI— décodent des états et prédisent la fausse croyance: artefact détecteur, non classe 3–6. Cela autorise à demander ce qui a été mesuré: ToM-score ou classement developmental —non la pratique lorsqu'un enfant attribue une croyance qu'il ne partage pas et qu'un adulte nomme le décalage.
Le problème s'aggrave par sept confusions de catégorie. Première: ce n'est pas le prosocial helping/sharing/consoling comme axe —Shi, Zhang y Zhu (2024) lient ToM et sharing; Rubio, Neira, Villacura-Herrera y Castillo (2022) prédisent aide et coopération via ToM; l'axe est voir/savoir, désir/croyance et fausse croyance simple, non aider/partager/consoler—. Deuxième: ce n'est pas la négociation de conflits / turn-taking. Troisième: ce n'est pas le SEL générique —il peut y avoir de l'émotion DANS la PT affective (Wang et al., 2026; Macheta, Gut y Pons, 2023); l'axe n'est pas un SEC auto-score—. Quatrième: ce n'est pas la participation/voix ni CLASS comme axe. Cinquième: ce n'est pas l'attention conjointe. Sixième: ce n'est pas les fonctions exécutives comme axe —Shahaeian, Haynes y Frick (2023) se lisent seulement comme contraste périphérique langage–ToM–FE—. Septième: ce n'est pas l'emotion monitoring clinique ni l'inclusion —Ari-Arat y Tutkun (2026) associent PT et intentions envers des pairs avec NEE; on ne réécrit pas cet article comme inclusion—. On ne recycle pas mark-making, dialogic reading, littératie, oralité, sand/water/playdough/loose parts/outdoor, bien-être, évaluation formative, documentation, STEM, motricité, créativité, jeu libre ni jeu symbolique comme axe: Wolf (2022) se cite pour la ToM (représentations inconsistantes et support externe), non comme pédagogie du jeu symbolique. Il y a une économie de coordination: les artefacts tiennent dans une diapositive; l'épisode d'un enfant qui attribue une fausse croyance simple et d'un adulte qui nomme le décalage, non. OECD (2021) exige des interactions significatives, avec une numérisation subordonnée. Contributions: séparer métier et artefacts; examiner des cas marqués; et offrir quatre épreuves de soutien.
2. État de l'art: de la pratique située de prise de perspective à l'artefact que l'on exhibe
Il convient de séparer quatre strates que le marché de «l'IA pour ToM / perspective-taking en éducation initiale» mélange d'ordinaire. La première est le construit de 3 à 6 ans comme pratique relationnelle située: attribuer à autrui un voir, un savoir, un désir ou une croyance qui peuvent ne pas coïncider avec les siens; fausse croyance simple; langage mentaliste; jeu de rôles qui exige de se mettre à la place de l'autre avec médiation (OECD, 2021; Wang et al., 2026; Liang et al., 2026; Heise y Bowman, 2025). La deuxième est le métier qui le cultive —adulte qui étaye le décalage, nomme des états mentaux et soutient que l'enfant attribue sans réduire à «correct/incorrect»; co-présence qui interprète le voir/savoir; récits qui rendent visible que l'autre n'a pas vu la même chose— (Mulvihill et al., 2023; Wang et al., 2026; Wolf, 2022). La troisième est l'évidence d'affordances de l'IA en ECE, de ToM computationnelle et de détecteurs de FB —sans les équivaloir à une pédagogie située— (Chen, 2024; Ljungcrantz, 2026; Nikolopoulou, 2025; Matta, 2026; Bhavna et al., 2024; Tison y Zawidzki, 2025). La quatrième est le cadre de pratique et de GenAI, qui traite le jeune enfant comme un sujet qui attribue des perspectives avec agentivité, non comme vecteur de ToM-score ni destinataire exclusif d'empathy-ToM cards ou de classements developmental (OECD, 2021; Miao y Holmes, 2023).
OECD (2021) ancre des interactions significatives: cadre. Les systèmes vérifiés mesurent des objets distincts du métier —Social Story de PT (Wang et al., 2026), VPT (Liang et al., 2026), MSL d'éducatrices (Mulvihill et al., 2023), CAT comme mesure (Heise y Bowman, 2025), FB sensible à l'objet, à l'appartenance et à la fantaisie (Süngü y Alıcı, 2025; Witt et al., 2022; Tuglaci e Ilgaz, 2025)—. Inférence: un mindreading index ne nomme pas «il ne l'a pas vu»; un adulte qui étaye le décalage de perspective, si. Chen (2024) et Ljungcrantz (2026) cartographient l'IA en ECE sans l'équivaloir à une ToM située. Nikolopoulou (2025) et Miao y Holmes (2023) fixent la prudence du GenAI. Matta (2026) revoit IA et ToM comme architecture d'attribution fonctionnelle: mindreading artificiel, non jardin d'enfants 3–6. Bhavna et al. (2024) saturent le plafond du détecteur. Tison y Zawidzki (2025) marquent la différence normative entre cognition sociale humaine et artificielle.
3. Méthode de revue
On a réalisé une revue narrative critique, non une méta-analyse primaire. Le propos n'était pas d'estimer une taille d'effet homogène des artefacts, mais d'articuler un argument de catégorie pédagogique avec des sources vérifiées. Critères d'inclusion: (a) 2021–2026, avec transfert marqué lorsque l'échantillon n'équivaut pas à 3–6 en classe de prise de perspective, inclut 7–8 ans ou 3–12 et des adultes, est fMRI/deep learning d'états cérébraux, est ToM computationnelle ou HRI/LLM de cognition sociale adulte/générale, ou l'objet est une mesure psychométrique sans équivaloir à la pédagogie; (b) ToM, perspective-taking, fausse croyance, VPT, langage mentaliste d'éducateurs, Social Story de PT, pretend play dans son lien avec la ToM, coopération prédite par la ToM, émotion–PT, ou IA en ECE / ToM computationnelle / détecteur de FB avec pertinence artefact/métier; (c) jardin d'enfants, préscolaire, CENDI ou 3–6, ou transfert explicite; (d) revue avec pairs, DOI ou rapport OECD/UNESCO GenAI; (e) DOI ou page éditoriale vérifiable. On a exclu comme objet central les axes déjà utilisés dans cette série —prosocial helping/sharing/consoling, négociation de conflits/turn-taking, SEL, participation/voix, CLASS, attention conjointe, inclusion, bien-être, évaluation formative, documentation, mark-making, dialogic reading, littératie, oralité, sand/water/playdough/loose parts/outdoor, jeu libre, jeu symbolique, STEM, motricité, créativité et investigation, et fonctions exécutives comme axe—. Shahaeian et al. (2023) seulement comme contraste périphérique. Shi et al. (2024) et Rubio et al. (2022) distinguent ToM de helping/sharing, ils ne recyclent pas l'axe du 8 septembre. Wolf (2022) se lit pour la ToM, non comme jeu symbolique. Heise y Bowman (2025) = mesure ≠ pédagogie; 3–8, transfert partiel. Bhavna et al. (2024) = 3–12 et adultes, fMRI: transfert. Matta (2026) et Tison y Zawidzki (2025) = ToM artificielle, transfert adulte/général.
La recherche a été exécutée le 9 septembre 2026 (slot 09:02 America/Mexico_City, weekday routine) sur des pages DOI, Crossref, Springer, Elsevier, Wiley, Taylor & Francis, MDPI, Frontiers, JAIR, OECD iLibrary, UNESDOC et sites éditoriaux. Chaque source a été vérifiée contre fuentes.md et crossref_check.json. On a distingué constat empirique, cadre et inférence pédagogique. On n'a inventé ni N, ni d, ni r, ni AUC ni DOI: lorsqu'un artefact manque d'essai vérifié comme paquet d'exhibition en CENDI 3–6, on le discute comme plafond de catégorie (Chen, 2024; Ljungcrantz, 2026; Nikolopoulou, 2025; Miao y Holmes, 2023; Matta, 2026; Bhavna et al., 2024; Tison y Zawidzki, 2025). On a utilisé vingt et une sources du corpus vérifié.
4. Cas 1. Un détecteur CV/multimodal de ToM / perspective-taking score / false-belief accuracy / mindreading index / mentalizing level / ToM developmental age, un GenAI de ToM worksheets/perspective scripts/false-belief lesson packs/empathy-ToM cards, un dashboard de ToM trials/heure, une VR/app/robot comme traitement fermé qui «entraîne la ToM», ou regard/proxémie/émotion/langage→classement ToM developmental level ne constituent pas un soutien à la théorie de l'esprit / prise de perspective
Chen (2024) et Ljungcrantz (2026) saturent le plafond des artefacts lorsque l'IA en ECE se présente comme si elle était un soutien à ToM / perspective-taking. Chen (2024) cartographie des affordances —tutorat, analytique, génération de contenus, agents—, non qu'un perspective-taking score cultive l'attribution située de voir/savoir. Ljungcrantz (2026) revoit l'interaction IA–ECE 2020–2024: état de l'art, non prise de perspective située. Inférence: «false-belief accuracy élevée = il y a eu soutien» est un plafond d'analytique. Un mindreading index peut coexister avec une absence d'étayage. La grammaire d'exhibition inverse la séquence: d'abord on active le détecteur; ensuite on déclare «il y a déjà de la ToM avec l'IA».
Nikolopoulou (2025) et Miao y Holmes (2023) nomment le risque du GenAI de ToM worksheets / perspective scripts / false-belief lesson packs / empathy-ToM cards par prompt qui ferme l'épisode: cadre de prudence, non essai versus un adulte qui nomme «il ne l'a pas vu; où cherchera-t-il ?» (OECD, 2021; Wang et al., 2026). Inférence: produire un worksheet par prompt peut être une préparation subordonnée; le soutien commence avec un décalage réel de perspective et un adulte qui nomme sans réduire à la correctness. Lorsque le script parle pour l'adulte et que le score parle pour l'enfant, le seuil de médiation humaine n'est pas respecté même si le dashboard paraît «vert». OECD (2021) exige des interactions significatives: un trial/heure n'est pas une interaction.
Bhavna et al. (2024) saturent l'ancre du détecteur et doivent se lire avec transfert marqué. Ils proposent un cadre de deep learning explicable pour décoder des états cérébraux (ToM et douleur) et prédire la performance en fausse croyance; dataset de l'ordre de 155 participants (122 enfants de 3–12 ans et 33 adultes). Statut: constat de neuroinformatique (pass/fail/inconsistent en FB). Transfert: 3–12 plus adultes; fMRI, non classe CENDI 3–6; prédiction de tâche ≠ évaluation pédagogique. Inférence: un système qui «détecte ToM» ou prédit false-belief accuracy n'équivaut pas à l'étayage de voir/savoir ni n'autorise CNN/vision/multimodal de regard, émotion ou langage comme ToM developmental age. Matta (2026) —scoping de 45 sources; architectures neuro-symboliques d'attribution fonctionnelle— est un cadre de mindreading artificiel, non une pédagogie de 3–6. Tison y Zawidzki (2025) argumentent que la cognition sociale humaine implique des attitudes normatives que les LLM n'implémentent pas: différence normative, non fiche d'un robot qui «entraîne le mindreading». Inférence restrictive: détecteur ≠ adulte qui nomme le décalage; GenAI d'empathy-ToM cards ≠ épisode ouvert; dashboard de trials/heure ≠ observation; VR/app/robot comme traitement fermé ≠ co-présence; classement par regard/proxémie/émotion/langage ≠ médiation. Les artefacts manquent, dans le corpus vérifié, d'essais d'équivalence pédagogique avec le métier en CENDI 3–6; on n'invente ni d, ni r ni AUC de «soutien». Ils partagent une grammaire de substitution: le score parle pour l'attribution; le GenAI ferme; le dashboard substitue l'observation; la VR/robot se vend comme traitement; le classement convertit le processus en niveau sans médiation.
5. Cas 2. Ce que le jardin d'enfants fait bel et bien lorsqu'il y a soutien à la prise de perspective: métier relationnel situé et ce que mesurent Wang Social Story, Liang VPT, Mulvihill MSL, Heise CAT, Süngü/Witt/Tuglaci fausse croyance, Wolf pretend play, Rubio, Ari-Arat et Macheta —avec Matta, Bhavna et Tison en transfert
Le plancher du métier n'est pas un score: ce sont des décalages réels de voir/savoir et de croyance; un étayage adulte qui nomme des états mentaux (penser, savoir, voir, vouloir, croire) et soutient que l'enfant attribue une perspective distincte de la sienne; une co-présence qui interprète l'épisode —non seulement «il a réussi le trial»—; et, lorsqu'il y a jeu de rôles, l'exigence de se mettre à la place de l'autre avec médiation, non un script de correctness (OECD, 2021; Wang et al., 2026; Mulvihill et al., 2023; Wolf, 2022). Inférence: il y a soutien lorsque l'on protège cette pratique; non lorsque l'on exhibe un perspective-taking score, un GenAI de worksheets ou un classement de ToM developmental level. Le métier se reconnaît dans l'épisode: un pair n'a pas vu le déplacement de l'objet; l'adulte nomme («elle n'était pas là; où cherchera-t-elle ?») et soutient que l'enfant attribue; le robot ou la VR, s'ils apparaissent, sont des moyens subordonnés, non des substituts.
Wang et al. (2026) saturent l'ancre de pratique médiée: quasi-expérience de 12 semaines avec 60 enfants chinois de 4–5 ans; Social Story versus business-as-usual; CPT et APT; SPT en prétest, post-test et suivi à deux mois. Constat empirique: le groupe d'entraînement a obtenu des gains plus élevés en SPT total, CPT et APT, maintenus au suivi. Inférence marquée: Social Story avec un adulte ≠ GenAI de perspective scripts comme recette fermée; gains en SPT ≠ ToM-score pédagogique ni VR/app comme traitement qui substitue la médiation. Liang et al. (2026) —254 préscolaires de 3–5 ans (130 filles); photographer task— saturent l'ancre de VPT: développement associé à des traits du stimulus, à l'âge et au SES. Inférence: la VPT est une base de voir/savoir («de là on ne voit pas»); non un dashboard de VPT-accuracy.
Mulvihill et al. (2023) —13 éducatrices; 77 enfants de 3–5 ans; MSL dans un album sans texte et dans une tâche de construction— ne trouvent pas de relation significative entre le MSL groupal et la ToM infantile. Statut: constat empirique, y compris le nul. Inférence restrictive: le langage mentaliste est matériel du métier —nommer voir, vouloir, savoir, croire dans l'épisode—, non un comptage qui «produit de la ToM» ni un mentalizing level de surveillance. Le métier exige une co-présence qui interprète le décalage concret, non seulement une instruction groupale. Heise y Bowman (2025) —n = 206; 3–8 ans; transfert partiel car il inclut 7–8— présentent le CAT (désirs divers, croyances diverses, accès à la connaissance, expertise, fausse croyance, VPT et faux signe; prédiction, explication et compréhension). Constat: mesure robuste qui réplique et nuance l'échelonnement de Wellman y Liu. Inférence de contraste: le CAT est un instrument de recherche, non un dashboard de ToM trials/heure ni une évaluation qui substitue l'adulte.
Süngü y Alıcı (2025) —150 enfants de 3–6 ans; FB standard et trois alternatives qui manipulent présence et localisation de l'objet— trouvent une prédominance de raisonnement de réalité et plus de réussites lorsque l'objet est retiré. Inférence: échouer un trial de FB n'équivaut pas à une «absence de ToM»; un false-belief accuracy interprète mal des stratégies de tâche. Witt et al. (2022) examinent à 4 ans si l'appartenance (accent; genre) influe sur l'attribution de fausse croyance: ils ne trouvent pas d'influence consistante. Inférence: l'attribution n'est pas un mindreading index stable; un classement uniforme efface la situationalité. Tuglaci e Ilgaz (2025) —FB fantastique versus réaliste, en contrôlant FE— trouvent une meilleure performance en FB fantastique; les enfants de 3 ans bénéficient lorsque la FB fantastique précède la réaliste. Inférence: le contexte change le rendement; un ToM-score de trials réalistes ne capture pas la prise de perspective située; on ne le convertit pas en axe de FE.
Wolf (2022) argumente que le pretend play précoce ne constitue pas par lui-même une évidence de ToM —il n'exige pas de distinguer la perspective propre de celle d'autrui—, mais qu'il constitue une évidence de manier des représentations inconsistantes avec un support externe; cette capacité sous-tend l'attribution de croyance. Distinction marquée: on le cite pour la ToM, non comme axe de jeu symbolique. Inférence: le jeu de rôles qui exige de se mettre à la place de l'autre a besoin de médiation; le support externe est le métier, non un robot-traitement. Rubio et al. (2022) —40 enfants de 3–7 ans (M = 5,075; transfert partiel car il inclut 7)— proposent que la ToM de premier ordre prédit l'aide de base et celle de second ordre, une coopération plus complexe. Inférence de distinction: la ToM peut prédire la coopération; cela ne recycle pas l'axe prosocial du 8 septembre ni ne convertit la coopération en perspective compliance. Ari-Arat y Tutkun (2026) —193 enfants de 4–6 ans; Bayburt, Türkiye— trouvent de petites associations entre capacités perçues et intentions envers des pairs avec NEE; la prise de perspective ne s'est pas associée de manière indépendante aux intentions. Inférence: la PT ne se laisse pas réduire à un inclusion-score; on ne convertit pas cet article en axe d'inclusion. Macheta et al. (2023) —99 enfants polonais de 3–6 ans; TEC et trois tâches de ToM— trouvent que seule la tâche d'opacité a prédit la compréhension émotionnelle. Inférence: accéder à un objet sous une description ne garantit pas d'y accéder sous toutes; emotion comprehension ≠ emotion monitoring clinique ni empathy-ToM card.
Matta (2026), Bhavna et al. (2024) et Tison y Zawidzki (2025) se lisent en transfert: ToM computationnelle, détecteur de FB et différence normative n'équivalent pas à une pédagogie de 3–6. Dans l'ensemble: il y a des systèmes qui entraînent la PT avec Social Story, décrivent la VPT, examinent le MSL, valident des mesures, montrent la sensibilité de la FB, discutent pretend play et ToM, prédisent la coopération, associent PT et intentions, lient opacité et émotion, ou décodent des états avec DL. Aucun —à lui seul— ne signe un décalage réel de voir/savoir, un langage mentaliste étayé, une co-présence qui interprète l'épisode et une agentivité pour attribuer une croyance distincte en classe. L'évidence technique est réelle dans son domaine; «score / GenAI / VR-traitement / détecteur = soutien à la ToM» est une inférence illégitime de catégorie.
6. Cas 3. ToM / prise de perspective ≠ prosocial helping/sharing/consoling, négociation de conflits/turn-taking, SEL comme axe, participation-voix, CLASS, attention conjointe, FE comme axe ni emotion monitoring clinique
Sept frontières protègent l'axe. Première: prosocial helping/sharing/consoling —Shi et al. (2024) situent ToM et émotions dans le sharing; Rubio et al. (2022) prédisent aide et coopération via ToM; il peut y avoir attribution de croyance DANS un épisode de sharing; l'axe est voir/savoir, désir/croyance et fausse croyance simple, non aider/partager/consoler, déjà publiés le 8 septembre—. Inférence: «nous travaillons le sharing = il y a de la ToM» ne signe pas. Deuxième: négociation de conflits / turn-taking —il peut y avoir un différend DANS un épisode de perspective; l'axe n'est pas le tour—. Troisième: SEL générique —Wang et al. (2026) entraînent l'APT; Macheta et al. (2023) lient opacité et émotion; l'axe n'est pas un SEC auto-score ni une empathy-ToM card—. Quatrième: participation/voix infantile —il y a parole mentaliste; on ne convertit pas cet article en voix déjà publiée—. Cinquième: CLASS / interactions comme axe —OECD (2021) ancre des interactions significatives; elle n'autorise pas à réduire la ToM à un score CLASS—. Sixième: attention conjointe —nommer «il ne l'a pas vu» n'est pas la joint attention comme axe—. Septième: FE comme axe et emotion monitoring clinique —Shahaeian et al. (2023) —N = 142; 3–6; trois vagues— trouvent que la FE précoce a influé sur la ToM, que l'effet est devenu bidirectionnel et que le langage a influé sur les deux; Tuglaci e Ilgaz (2025) contrôlent FE; on les lit seulement comme contraste périphérique. Ari-Arat y Tutkun (2026) empêchent de recycler l'inclusion. Miao y Holmes (2023) et Nikolopoulou (2025) exigent une médiation du GenAI. Inférence: l'IA cohérente à 3–6 demeure du côté de l'adulte, non comme détecteur, GenAI de lesson packs, dashboard, VR-traitement, robot de mindreading ni classement sans médiation.
Ces frontières protègent l'axe. ToM / prise de perspective peut toucher, de manière latérale, sharing, coopération, émotion, langage, FE ou intentions envers des pairs avec NEE; on ne la laisse pas réduire à ces axes déjà publiés. Un centre qui «travaille le SEL», «note le helping» ou «entraîne la FE» n'a pas démontré par cette seule étiquette le métier d'étayer voir/savoir, désir/croyance et fausse croyance simple. Shi et al. (2024) et Rubio et al. (2022) se lisent par distinction, non comme axe prosocial; Shahaeian et al. (2023) se lisent par périphérique, non comme axe de FE; Wolf (2022) se lit pour la ToM, non comme axe de jeu symbolique.
7. Cadre inférentiel: quatre épreuves pour affirmer qu'il y a soutien à la théorie de l'esprit / prise de perspective, non un artefact
Le cadre qui suit est une inférence pédagogique de cet article, ancrée dans les cas et dans les instruments vérifiés. Ce n'est pas une nouvelle norme internationale. Il distingue quatre épreuves. Si un jardin d'enfants, un préscolaire, un CENDI ou une école infantile ne les passe pas, il ne peut déclarer que les artefacts constituent un soutien au développement de la théorie de l'esprit / prise de perspective dans la petite enfance.
7.1. Épreuve de la pratique située (décalage réel de voir/savoir et de croyance; fausse croyance simple; désir/croyance; agentivité pour attribuer une perspective distincte), non du détecteur CV/multimodal ni de la VR/app/robot d'«entraîner la ToM». OECD (2021) et les cas de pratique et de tâche (Wang et al., 2026; Liang et al., 2026; Süngü y Alıcı, 2025; Witt et al., 2022; Tuglaci e Ilgaz, 2025; Wolf, 2022) définissent le contraste métier/artefact. Chen (2024), Ljungcrantz (2026), Matta (2026), Bhavna et al. (2024, transfert) et Tison y Zawidzki (2025) cartographient analytique, ToM computationnelle et détecteur comme affordance ou architecture, non comme prise de perspective située. Inférence: si l'«évidence» est ToM-score, false-belief accuracy, mindreading index, mentalizing level ou ToM developmental age, le centre a fait de l'analytique ou du décodage, non du soutien.
7.2. Épreuve de la co-présence adulte qui nomme des états mentaux et étaye le décalage —non seulement «il a réussi le trial»—, non du GenAI de ToM worksheets / perspective scripts / false-belief lesson packs / empathy-ToM cards. OECD (2021), Wang et al. (2026), Mulvihill et al. (2023) et Wolf (2022, support externe) situent pratique et médiation. Miao y Holmes (2023) et Nikolopoulou (2025) exigent une médiation du GenAI. Inférence: un script par prompt ou un lesson pack fermé ne signent pas l'épisode de classe dans lequel l'adulte nomme «elle ne l'a pas vu» et l'enfant attribue.
7.3. Épreuve de la médiation humaine et de l'interprétation de la ToM comme pratique relationnelle, non du dashboard de ToM trials/heure / perspective compliance ni du classement par regard/proxémie/émotion faciale/langage. OECD (2021) exige des interactions significatives. Heise y Bowman (2025) ancrent mesure ≠ pédagogie. Süngü y Alıcı (2025), Witt et al. (2022) et Tuglaci e Ilgaz (2025) ancrent la sensibilité de la FB à la tâche, non la surveillance de comptages. Inférence: des trials/heure élevés n'élèvent pas à eux seuls l'étayage. La préparation subordonnée de l'adulte est légitime; le scorer qui convertit l'enfant en vecteur de ToM-score ne l'est pas.
7.4. Épreuve de la distinction de catégorie et du jugement professionnel, non du catalogue de produit. ToM / perspective-taking ≠ prosocial helping/sharing/consoling, négociation de conflits/turn-taking, SEL, participation-voix, CLASS, attention conjointe, FE comme axe ni emotion monitoring clinique. Shi et al. (2024), Rubio et al. (2022), Shahaeian et al. (2023, périphérique), Macheta et al. (2023) et Ari-Arat y Tutkun (2026) empêchent ces confusions. Miao y Holmes (2023), Nikolopoulou (2025) et OECD (2021) exigent une médiation humaine. Inférence: le soutien s'accomplit avec un décalage réel de perspective, une co-présence qui nomme/étaye et une agentivité pour attribuer —non en notant la ToM ni en substituant la médiation par un robot.
Le cadre admet le numérique subordonné à la préparation de l'adulte (Wang et al., 2026, lu comme pratique médiée, non comme recette GenAI; Heise y Bowman, 2025, comme mesure pour le chercheur, non comme dashboard). Il refuse de déclarer un soutien par les artefacts (Miao y Holmes, 2023; Nikolopoulou, 2025; Bhavna et al., 2024; Matta, 2026). Les quatre épreuves se lisent ensemble.
8. Discussion
Trois tensions. Première: exhiber les artefacts versus exercer le soutien. Les cas des sections 5–6 —avec transferts et distinctions marqués— soutiennent le contraste; Chen (2024) et Ljungcrantz (2026) cartographient l'IA sans équivalence à une ToM située. Deuxième: assessment automatisé ou VR-traitement versus pédagogie relationnelle —déclarer un soutien par false-belief accuracy, mindreading index ou par un détecteur d'états cérébraux est une pédagogie inversée; Heise y Bowman (2025) montrent que même une mesure compréhensive n'est pas le métier—. Troisième: GenAI d'empathy-ToM cards / robot qui «entraîne le mindreading» / classement par regard versus métier (Miao y Holmes, 2023; Nikolopoulou, 2025; OECD, 2021; Tison y Zawidzki, 2025): vendre la ToM computationnelle ou la prédiction de FB comme «ToM avec IA» au jardin d'enfants confond produit et pratique. Mulvihill et al. (2023) confirment que le MSL groupal ne se laisse pas traduire en ToM-score; Süngü y Alıcı (2025) confirment qu'un trial de FB interprète mal des stratégies; Miao y Holmes (2023) subordonnent la génération au jugement professionnel.
Les quatre épreuves de la section 7 lisent ces tensions. Le contraste empirique définit le plancher que les artefacts n'atteignent pas seuls. Inférence: le soutien s'érode lorsqu'on les traite comme s'ils étaient la pratique. Le numérique subordonné est légitime vers l'adulte (préparation du langage mentaliste; CAT pour le chercheur, non pour le dashboard; Wang et al., 2026, comme pratique médiée); inverser la séquence ne l'est pas (OECD, 2021). Si le centre montre des décalages réels de voir/savoir et de croyance, un adulte qui a nommé des états mentaux, et des enfants qui ont attribué une perspective distincte avec agentivité, il peut parler de soutien; s'il ne montre que des détecteurs, des scripts GenAI, des trials/heure, des VR-traitements, des robots de mindreading ou des classements sans médiation, il parle d'artefacts. Chen (2024) et Ljungcrantz (2026): affordances de l'IA en ECE ≠ ToM située.
9. Limites
Cette revue est narrative. Elle n'applique pas de PRISMA propre ni n'estime d'effets combinés. On n'invente ni d, ni r ni AUC. Wang et al. (2026) sont une quasi-expérience (60; 4–5): pratique médiée, non recette GenAI. Liang et al. (2026) mesurent la VPT (254; 3–5): construit visuel. Mulvihill et al. (2023) mesurent 13 éducatrices et 77 enfants: nul avec prudence. Heise y Bowman (2025) mesurent n = 206 à 3–8: transfert partiel; le CAT est une mesure, non une classe. Süngü y Alıcı (2025) mesurent 150 enfants en FB de laboratoire. Witt et al. (2022) délimitent 4 ans et l'appartenance. Tuglaci e Ilgaz (2025) manipulent la fantaisie en FB: on ne les convertit pas en axe de FE. Wolf (2022) est un argument philosophique. Rubio et al. (2022) mesurent 40 enfants de 3–7: transfert partiel; distinction, non axe prosocial. Ari-Arat y Tutkun (2026) utilisent la convenance (193; 4–6). Macheta et al. (2023) mesurent N = 99. Shahaeian et al. (2023) sont longitudinaux (N = 142): périphériques de FE. Shi et al. (2024) s'utilisent seulement pour distinguer le sharing. Bhavna et al. (2024) sont fMRI 3–12 plus adultes: transfert. Matta (2026) et Tison y Zawidzki (2025) sont des cadres IA–ToM, non ECE 3–6. Chen (2024), Ljungcrantz (2026) et Nikolopoulou (2025) cartographient l'IA en ECE, non le paquet d'exhibition dans un CENDI latino-américain. On n'a pas localisé d'essais vérifiés des artefacts comme paquet unique de «ToM avec IA» en classe 3–6; on les discute comme plafond de catégorie. OECD et Miao y Holmes sont de cadre. Les inférences de la section 7 sont des hypothèses de catégorie, non une évidence d'implémentation.
10. Conclusions
Les artefacts —détecteur CV/multimodal ou scores de ToM / perspective-taking / false-belief accuracy / mindreading index / mentalizing level / ToM developmental age; GenAI de worksheets/scripts/lesson packs/empathy-ToM cards; dashboard de trials/heure; VR/app/robot comme traitement fermé; classement sans médiation— ne constituent pas un soutien au développement de la théorie de l'esprit / prise de perspective en éducation initiale. Chen (2024) et Ljungcrantz (2026) confirment des affordances sans équivalence à une ToM située. Nikolopoulou (2025) et Miao y Holmes (2023) fixent les limites du GenAI. Les cas empiriques (sections 5–6) exigent de lire Social Story, VPT, MSL, CAT, FB, pretend play, coopération, émotion–PT, langage–ToM–FE et sharing par ce qu'ils mesurent et par ce à quoi ils n'équivalent pas comme pédagogie située. Matta (2026), Bhavna et al. (2024) et Tison y Zawidzki (2025) se lisent comme plafond d'artefact, non comme métier de 3–6. Lorsqu'il y a soutien, il y a des décalages réels de voir/savoir et de croyance, une co-présence qui nomme des états mentaux et une agentivité pour attribuer une perspective distincte (OECD, 2021). ToM / prise de perspective se distingue de helping/sharing/consoling, de la négociation de conflits/turn-taking, du SEL, de la participation-voix, de CLASS, de l'attention conjointe, de FE comme axe et de l'emotion monitoring clinique.
Là où les sources ne mesurent pas un jardin d'enfants, cet article ne l'affirme pas. Là où elles mesurent des cartographies d'IA, Social Story de PT, VPT, MSL d'éducatrices, CAT, FB sensible à objet/appartenance/fantaisie, pretend play, coopération, émotion–PT, langage–ToM–FE, sharing, ToM computationnelle ou prédiction de FB avec transfert, il ne les traduit pas en soutien via ToM-score, worksheet par prompt, VR-traitement fermé ni robot-substitut. Accompagner les filles et les garçons de trois à six ans dans la théorie de l'esprit / prise de perspective, c'est exercer des décalages réels de voir/savoir et de croyance, une fausse croyance simple, désir/croyance, un langage mentaliste, un jeu de rôles qui exige de se mettre à la place de l'autre avec médiation, un étayage qui nomme des états mentaux, et une co-présence qui interprète la ToM comme pratique relationnelle située, non comme «ToM-score». Le reste est détecteur, GenAI de worksheets, dashboard de trials, VR-traitement fermé, robot de mindreading et classement. Ce n'est pas un soutien à la théorie de l'esprit / prise de perspective en éducation initiale, et cela ne doit pas se présenter comme ce qu'il n'est pas.
Laboratorio Editorial de NEXTECH.IA / Ingeniero Mitre.
Références
- Ari-Arat, C., y Tutkun, C. (2026). Associations between preschool children’s perspective-taking skills and their perceived abilities and behavioral intentions toward peers with special educational needs. Current Psychology, 45(17). https://doi.org/10.1007/s12144-026-09997-4
- Bhavna, K., Akhter, A., Banerjee, R., y Roy, D. (2024). Explainable deep-learning framework: decoding brain states and prediction of individual performance in false-belief task at early childhood stage. Frontiers in Neuroinformatics, 18. https://doi.org/10.3389/fninf.2024.1392661
- Chen, J. J. (2024). A scoping study on AI affordances in early childhood education: Mapping the global landscape, identifying research gaps, and charting future research directions. Journal of Artificial Intelligence Research, 81, 701–740. https://doi.org/10.1613/jair.1.16882
- Heise, M. J., y Bowman, L. C. (2025). The Comprehensive Assessment of Theory of Mind (CAT): A novel measure of 3- to 8-year-old children’s theory of mind and an evaluation of mental-state scaling. Child Development, 96(5), 1787–1806. https://doi.org/10.1111/cdev.14263
- Liang, J., Sun, J., Xu, X., Lee, K., y Siu, C. T. S. (2026). Early development of visual perspective-taking: Its associations with stimuli feature, child age, and family socio-economic status. Early Childhood Education Journal, 54(2), 757–772. https://doi.org/10.1007/s10643-025-01866-2
- Ljungcrantz, L. (2026). The interaction of AI and early childhood education. A state-of-the-art review 2020–2024. Early Childhood Education Journal, 54(5), 3565–3581. https://doi.org/10.1007/s10643-025-02079-3
- Macheta, K., Gut, A., y Pons, F. (2023). The link between emotion comprehension and cognitive perspective taking in theory of mind (ToM): a study of preschool children. Frontiers in Psychology, 14. https://doi.org/10.3389/fpsyg.2023.1150959
- Matta, D. (2026). Artificial intelligence and theory of mind. Journal of Psychology and AI, 2(1). https://doi.org/10.1080/29974100.2026.2628373
- Miao, F., y Holmes, W. (2023). Guidance for generative AI in education and research. UNESCO. https://doi.org/10.54675/ewzm9535
- Mulvihill, A., Armstrong, R., Casey, C., Redshaw, J., Scarinci, N., y Slaughter, V. (2023). Early childhood educators' mental state language and children's theory of mind in the preschool setting. British Journal of Developmental Psychology, 41(3), 227–245. https://doi.org/10.1111/bjdp.12449
- Nikolopoulou, K. (2025). Child-centered integration of generative AI in early learning: Balancing promises and challenges. AI, Brain and Child, 1(1). https://doi.org/10.1007/s44436-025-00023-1
- OECD. (2021). Starting Strong VI: Supporting meaningful interactions in early childhood education and care. OECD Publishing. https://doi.org/10.1787/f47a06ae-en
- Rubio, F., Neira, C., Villacura-Herrera, C., y Castillo, R. D. (2022). First and second-order theory of mind as predictors of cooperative behaviors in preschool and school children. Psykhe, 31(SI 1). https://doi.org/10.7764/psykhe.2021.36317
- Shahaeian, A., Haynes, M., y Frick, P. J. (2023). The role of language in the association between theory of mind and executive functioning in early childhood: New longitudinal evidence. Early Childhood Research Quarterly, 62, 251–258. https://doi.org/10.1016/j.ecresq.2022.09.003
- Shi, Y., Zhang, M., y Zhu, L. (2024). Sharing and allocation in preschool children: The roles of theory of mind, anticipated emotions, and consequential emotions. Behavioral Sciences, 14(10), Article 931. https://doi.org/10.3390/bs14100931
- Süngü, M., y Alıcı, T. (2025). Discrimination of false response from object reality in false belief test in preschool children. Journal of Intelligence, 13(10), Article 124. https://doi.org/10.3390/jintelligence13100124
- Tison, R., y Zawidzki, T. (2025). Human versus artificial social cognition and metacognition: the normative difference. AI and Ethics, 5(5), 5255–5271. https://doi.org/10.1007/s43681-025-00774-w
- Tuglaci, E., y Ilgaz, H. (2025). The effect of fantastical elements on preschoolers’ false belief task performance. Journal of Experimental Child Psychology, 260, Article 106321. https://doi.org/10.1016/j.jecp.2025.106321
- Wang, X., Wang, J., Qin, L., Wu, Y., y Wu, J. (2026). Promoting cognitive and affective perspective-taking in 4-5-year-olds through social story training: A quasi-experimental study. Early Childhood Education Journal, 54(5), 3627–3638. https://doi.org/10.1007/s10643-025-02093-5
- Witt, S., Seehagen, S., y Zmyj, N. (2022). The influence of group membership on false-belief attribution in preschool children. Journal of Experimental Child Psychology, 222, Article 105467. https://doi.org/10.1016/j.jecp.2022.105467
- Wolf, J. (2022). Implications of pretend play for Theory of Mind research. Synthese, 200(6), Article 523. https://doi.org/10.1007/s11229-022-03984-5