Faire tourner une IA puissante sur un téléphone se heurte à un mur physique : la mémoire vive. Un modèle doit normalement tenir entièrement en mémoire active pour fonctionner, ce qui limite drastiquement sa taille sur un appareil grand public. Apple affirme avoir contourné ce mur avec une astuce élégante, et le résultat mérite d'être expliqué, car il concerne l'avenir de toute l'IA embarquée.
Nous avions relevé, dans notre article sur les lunettes connectées, que Apple semblait en retard sur l'IA grand public. C'est vrai sur les produits. Ça l'est beaucoup moins sur la recherche, comme le montre la troisième génération de ses modèles de fondation, présentée en juin 2026 et attendue sur les appareils à l'automne. Voici l'idée technique qui la rend intéressante.
La gamme, en bref
Apple a présenté une famille de cinq modèles, répartis entre l'appareil et le serveur. Deux tournent localement : AFM 3 Core, un modèle dense d'environ 3 milliards de paramètres pour les tâches quotidiennes, et AFM 3 Core Advanced, le plus puissant des deux. Trois autres tournent sur les serveurs de Private Cloud Compute, dont un modèle d'image et un modèle de raisonnement avancé.
Un point mérite d'être clarifié parce qu'il a été mal rapporté. Apple a signé en janvier 2026 un accord pluriannuel avec Google, et une déclaration commune décrivait alors la future famille AFM comme bâtie en collaboration avec Google et fondée sur sa technologie Gemini. Mais la présentation technique d'Apple insiste sur sa propre architecture, et son responsable de l'IA a précisé que l'approche était fondée sur la distillation, et non sur une adoption telle quelle de Gemini. Autrement dit, les modèles d'Apple ont appris en observant ceux de Google, une technique que nous avons expliquée dans notre article sur la distillation, mais ce ne sont pas des modèles Gemini rebadgés.
L'astuce : le modèle dort dans le flash
Venons-en à la partie réellement intéressante. AFM 3 Core Advanced compte environ 20 milliards de paramètres au total, mais n'en active que 1 à 4 milliards par requête.
Le problème que ça résout est concret. Habituellement, un modèle doit être entièrement chargé dans la mémoire vive, la DRAM, ce qui crée une empreinte énorme et limite la taille des modèles sur du matériel grand public. La solution d'Apple : stocker le modèle complet dans la mémoire flash (celle où sont vos photos et vos applications, beaucoup plus vaste et beaucoup moins chère), et ne charger en mémoire vive que les morceaux nécessaires à la requête en cours.
La question devient alors : comment savoir à l'avance quels morceaux réveiller ? C'est là qu'intervient une technique développée par les chercheurs d'Apple, l'élagage guidé par instruction (Instruction-Following Pruning). Plutôt que de décider une fois pour toutes, à l'entraînement, quelles parties du modèle sont actives, un petit prédicteur lit votre demande et choisit dynamiquement, pour cette requête précise, quelles portions du réseau activer.
Imaginez une immense bibliothèque et un bureau minuscule. Vous ne pouvez pas poser tous les livres sur le bureau, il est trop petit. Alors un bibliothécaire lit votre question, court chercher les trois ou quatre ouvrages pertinents, et vous les apporte. La bibliothèque, c'est la mémoire flash. Le bureau, c'est la mémoire vive. Le bibliothécaire, c'est le prédicteur. Vous avez accès à toute la connaissance sans avoir besoin d'un bureau gigantesque.
Le résultat publié par les chercheurs d'Apple est parlant : leur modèle à 3 milliards de paramètres activés dépassait de 5 à 8 points une référence dense de même taille sur les mathématiques et le code, tout en égalant la performance d'un modèle dense de 9 milliards. Autrement dit, on obtient les capacités d'un modèle trois fois plus gros, pour le coût mémoire du petit.
Pourquoi c'est important au-delà d'Apple
Cette approche répond directement à la limite que nous décrivions dans notre guide de l'IA locale : la mémoire disponible détermine la taille du modèle que vous pouvez faire tourner chez vous. Si on peut stocker un gros modèle dans le stockage et n'en réveiller qu'une fraction, cette contrainte se desserre considérablement.
Les conséquences sont concrètes. Un modèle plus capable qui tourne sur votre appareil, c'est une IA qui fonctionne sans connexion, qui ne fait sortir aucune donnée, et qui ne coûte rien à l'usage. Apple en fait d'ailleurs son argument central, en réaffirmant qu'elle n'utilise pas les données personnelles pour entraîner ses modèles, et que les requêtes sont traitées soit localement, soit via une infrastructure où l'information reste inaccessible, y compris à Apple elle-même.
Détail qui a fait sourciller les observateurs : pour son modèle le plus puissant, Apple a travaillé avec Google et NVIDIA pour étendre Private Cloud Compute à des cartes graphiques NVIDIA hébergées dans Google Cloud, tout en affirmant maintenir les mêmes garanties de confidentialité. Une entreprise qui a bâti son discours sur le fait de tout garder en interne accepte donc de faire tourner une partie de son IA chez son principal concurrent. C'est un compromis assumé, adossé à des mécanismes techniques de vérification, mais c'est un compromis.
Ce qu'il faut retenir
Apple n'a pas gagné la course aux modèles les plus puissants, et ce n'était visiblement pas son objectif. Ce qu'elle poursuit est différent : la meilleure IA possible dans les contraintes d'un appareil que vous avez dans la poche, sans que vos données n'en sortent. C'est un problème d'ingénierie plus qu'un problème d'échelle, et l'élagage guidé par instruction en est une réponse élégante.
La question qui reste ouverte est celle de l'exécution produit. Les modèles doivent arriver à l'automne 2026 avec les mises à jour système, sur les machines et les iPhone les plus récents. Apple a une histoire compliquée avec les promesses d'IA, notamment sur Siri, comme nous l'avons évoqué à propos de l'accord Gemini pour le nouvel assistant. Une architecture élégante sur le papier ne vaut que par ce qu'elle donne entre les mains des gens. Rendez-vous à l'automne.