CE QUE DIT LA RECHERCHE

Ce que dit la recherche

Neuf fiches preuves sourcées : les gains documentés de l'IA générative, et leurs limites. Chaque fiche porte un statut de fiabilité V/C et un marqueur ✅ Stable / ⚠️ Mouvant / 🔎 À vérifier.

Ce que la recherche établit, ce qu'elle ne tranche pas. Les gains de productivité de l'IA générative sont réels et documentés sur certaines tâches (rédaction, synthèse, support), surtout pour les moins expérimentés. Mais ils sont hétérogènes — selon le type de tâche (le « jagged frontier »), le niveau d'expertise, et parfois contre-intuitifs (des experts ralentis, cf. METR 2025). Au niveau macroéconomique et en entreprise, l'effet agrégé reste, à ce jour, difficile à mesurer. Nous distinguons systématiquement les sources primaires des chiffres d'éditeurs, et nous datons les repères mouvants.

1. Écriture professionnelle — le RCT de référence

V ✅ Stable

« Experimental evidence on the productivity effects of generative artificial intelligence », Shakked Noy & Whitney Zhang (MIT), Science, vol. 381, 14 juillet 2023 (DOI 10.1126/science.adh2586) · Essai contrôlé randomisé pré-enregistré, tâches de rédaction professionnelle incitées · 453 professionnels diplômés du supérieur (managers, RH, rédacteurs de subventions, marketing, consultants, analystes)

Résultat : Temps moyen −40 %, qualité +18 % ; réduction des inégalités entre travailleurs (les moins performants progressent le plus).

Sens : Gain de productivité + effet de nivellement.

Limites : Tâches courtes (20-30 min) en laboratoire ; effets d'équilibre général non mesurés ; l'IA substitue l'effort plus qu'elle ne complète les compétences.

Niveau de preuve : Élevé (RCT publié)

Encart « Ce que dit la recherche » (repris dans les fiches concernées) : Ce que dit la recherche : dans un essai randomisé publié dans Science (Noy & Zhang, 2023), l'accès à l'IA a réduit de 40 % le temps de rédaction et amélioré la qualité de 18 %, avec un effet plus marqué pour les rédacteurs les moins expérimentés.

2. Fonctions support / relation usager — étude de terrain

V ✅ Stable

« Generative AI at Work », Erik Brynjolfsson, Danielle Li, Lindsey R. Raymond, NBER Working Paper 31161 (2023) ; publié dans The Quarterly Journal of Economics, vol. 140(2), 2025, p. 889-942 (DOI 10.1093/qje/qjae044) · Étude de terrain, mise en service échelonnée (staggered) d'un assistant IA conversationnel · 5 179 agents de support client

Résultat : Productivité (dossiers résolus/heure) +14 % en moyenne, +34 % pour les agents novices ou peu qualifiés, impact minime sur les agents expérimentés ; amélioration de la satisfaction client et de la rétention. Verbatim : « Access to the tool increases productivity, as measured by issues resolved per hour, by 14% on average, including a 34% improvement for novice and low-skilled workers but with minimal impact on experienced and highly skilled workers. »

Sens : Gain concentré sur les moins expérimentés (diffusion des bonnes pratiques).

Limites : Un seul secteur ; apprentissage « suggestif » ; gains faibles voire légère baisse de qualité pour les plus expérimentés.

Niveau de preuve : Élevé (quasi-expérimental publié en revue)

3. Le « jagged frontier » — la nuance décisive

V ✅ Stable

« Navigating the Jagged Technological Frontier », Dell'Acqua, McFowland, Mollick, Lifshitz-Assaf, Kellogg, Rajendran, Krayer, Candelon, Lakhani (Harvard / BCG), 2023 ; à paraître dans Organization Science · Expérience de terrain pré-enregistrée, GPT-4, 18 tâches de conseil réalistes · 758 consultants du Boston Consulting Group (≈7 % de l'effectif contributeur)

Résultat : Dans la frontière de capacité : +12,2 % de tâches complétées, 25,1 % plus vite, +40 % de qualité. Hors frontière, l'IA dégrade la performance (≈ −23 %).

Sens : Gain massif mais conditionnel au type de tâche ; risque de sur-confiance.

Limites : La difficulté d'une tâche ne prédit pas sa position ; l'output hors-frontière « semble bon » — d'où la vigilance humaine.

Niveau de preuve : Élevé

4. Résultat contre-intuitif — le garde-fou méthodologique

V ⚠️ Mouvant

« Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity », METR (Becker, Rush, Barnes, Rein), arXiv 2507.09089, juillet 2025 · RCT, 246 tâches réelles · 16 développeurs open-source expérimentés (≈5 ans sur leurs propres dépôts), outils Cursor Pro / Claude 3.5-3.7 Sonnet

Résultat : Les développeurs sont 19 % PLUS LENTS avec l'IA — alors qu'ils prévoyaient +24 % et s'estimaient ensuite +20 % plus rapides (écart perception/réalité de 39 points).

Sens : Contre-productif dans ce contexte précis (experts, code mature, standards élevés). Usage QUUBE : preuve d'honnêteté — la valeur dépend de la tâche, de l'expertise et du cadre ; toujours croiser perception déclarée et mesure objective.

Limites : Petit échantillon, contexte défavorable à l'IA, capacités « early-2025 » ; METR a depuis fait évoluer son protocole (mise à jour février 2026). Ne pas généraliser dans un sens ni dans l'autre.

Niveau de preuve : Élevé (RCT), périmètre étroit — V sur le résultat, portée mouvante

5. Le paradoxe de productivité en entreprise

V 🔎 À vérifier

« Artificial Intelligence, Productivity, and the Workforce: Evidence from Corporate Executives », NBER Working Paper 34984 (février 2026) · Enquête déclarative rigoureuse (Survey of Business Uncertainty étendue), panel longitudinal, 4 pays · ≈6 000 dirigeants (États-Unis, Royaume-Uni, Allemagne, Australie)

Résultat : Malgré 69 % d'adoption, 89 % des entreprises ne constatent aucun changement de productivité (ventes/employé) et plus de 90 % aucun impact sur l'emploi sur 3 ans ; anticipation modeste de +1,4 % de productivité à 3 ans. Verbatim : « More than 90 percent of managers say AI had no impact on employment [...], and 89 percent saw no change in productivity. »

Sens : Pas de gain agrégé mesurable à ce stade — l'écart entre gain individuel et gain organisationnel est le vrai sujet.

Limites : Déclaratif ; mesure de productivité grossière (ventes/employé).

Niveau de preuve : Élevé pour une enquête

6. Santé — IA ambiante et charge documentaire (RCT)

V ✅ Stable

Essai contrôlé randomisé pragmatique stepped-wedge, NEJM AI, 2026 (scribe IA ambiant, bien-être des praticiens ; DOI 10.1056/AIoa2500945) · RCT stepped-wedge sur 24 semaines (3 séquences de 6 semaines), Stanford Professional Fulfillment Index · 66 praticiens en clinique ambulatoire (2 États américains)

Résultat : Réduction significative de l'épuisement et du désengagement interpersonnel, baisse du temps documentaire et du « travail hors travail », sans dégradation de la conformité de facturation. Verbatim : « Ambient AI scribes may reduce health care practitioner work exhaustion, interpersonal disengagement, and documentation burden without compromising billing compliance. »

Sens : Les scribes IA ambiants peuvent réduire l'épuisement des praticiens et la charge documentaire sans compromettre la conformité de facturation.

Limites : Petit échantillon, contexte américain, technologie clinique spécialisée (différente d'une IA généraliste).

Niveau de preuve : Élevé (RCT)

7. Santé — scribe ambiant en conditions réelles (nuance)

C ⚠️ Mouvant

« Ambient AI Scribes in Clinical Practice: A Multisite Observational Study », Tierney AA et al., JAMA, 2026 · Étude observationnelle quasi-expérimentale multisite (2023-2025) · 1 800 cliniciens, 5 centres hospitalo-universitaires

Résultat : −16 min de documentation et −13 min dans le dossier patient par 8 h de consultation ; ≈1 patient supplémentaire toutes les 2 semaines ; gains supérieurs en médecine générale et chez les cliniciennes. Verbatim : « Scribe adopters were able to see one additional patient every two weeks. »

Sens : Gain réel mais modeste et hétérogène.

Limites : Effet variable selon spécialité, genre, intensité d'usage — l'hétérogénéité devient le sujet.

Niveau de preuve : Élevé, résultat mitigé

8. France — effet macro et adoption (cadrage institutionnel)

V ✅ Stable

Trésor-Éco n° 391, « L'intelligence artificielle, quels effets sur l'emploi ? », DG Trésor, 30 juin 2026, signée Martin Chopard, Elisa Cotet, Tristan Gantois et Eloïse Villani · Note de synthèse (revue de littérature économique — Aghion et al. 2025, Bergeaud 2024, Brynjolfsson et al. 2025) · France — cadrage national

Résultat : « Les études empiriques ne permettent pas de déterminer l'effet total de l'IA sur l'emploi, faute de recul suffisant » ; gains de productivité « à peine observables » au niveau macro (adoption encore limitée/inégale) ; premières suppressions d'emploi concentrées en finance et informatique ; « 62 % des Français la voient comme un risque pour l'emploi, selon le baromètre du numérique 2025 ». À compléter (INSEE, Note de conjoncture mars 2026) : l'IA contribuerait à ≈1/3 de la croissance américaine 2025 (+0,7 pt de PIB) contre +0,1 pt en France (C, mouvant).

Sens : Cadrage prudent ; recommande formation et accompagnement public.

Limites : Note de synthèse, pas de mesure originale ; manque de recul souligné par les auteurs eux-mêmes.

Niveau de preuve : Moyen (synthèse), source primaire institutionnelle

9. France — adoption des cadres vs formation (shadow AI)

V ✅ Stable

Apec, baromètre « Les cadres et l'IA » (enquête mars 2026, échantillon représentatif de 2 000 cadres), publié le 21 mai 2026 · Enquête annuelle sur échantillon représentatif · 2 000 cadres français

Résultat : 50 % des cadres utilisent l'IA générative au moins une fois par semaine (contre 35 % un an plus tôt ; usage quotidien 21 % contre 12 % en 2025 ; 62 % chez les moins de 35 ans, +20 pts ; 55 % chez les managers). Verbatim : « Seuls 29 % des cadres déclarent avoir été formés à l'IA (contre 24 % en 2025), mais davantage pour des contenus généralistes que métiers. » Écart adoption/formation ≈ 21 points — marqueur du « shadow AI ». Contexte : « 70 % des grandes entreprises acceptent voire encouragent l'usage de l'IA (+17 pts) » ; 27 % ont mis en place des chartes (17 % en 2025), 37 % ont mis en place des formations (20 % en 2025).

Sens : L'adoption précède la formation ; la légitimation par l'AI Act art. 4 est une réponse directe.

Limites : Déclaratif (biais d'auto-évaluation des gains).

Niveau de preuve : Moyen, source d'autorité française annuelle

Note sur les chiffres d'éditeurs / cabinets (statut NV — exclus des affirmations). NV 🔎 À vérifier

Les projections McKinsey (« The economic potential of generative AI », 2023 : 2,6 à 4,4 trillions USD de valeur annuelle potentielle sur 63 cas d'usage ; +0,1 à +0,6 pt de productivité du travail par an d'ici 2040) sont des estimations prospectives, non des mesures — à présenter comme telles, marquées 🔎 / NV, jamais comme des faits acquis. De même, une étude très récente non encore relue par les pairs (Merali, arXiv 2512.21316, déc. 2025 : « +81 % de gains par minute » et +146 % de gains totaux par minute sur plus de 500 consultants/analystes/managers, 13 LLMs, RCT pré-enregistré) est citable en signalant explicitement son statut de preprint — et le fait que, avec un humain dans la boucle, l'effet de qualité s'estompe (les humains ramènent l'output des meilleurs modèles vers leur propre niveau). La projection « +20 % de productivité américaine sur la décennie » y est une extrapolation, pas un résultat observé.