Auteur : Long Yue, Wallstreetcn
Il y a trois ans, le PDG de Meta, Zuckerberg, a déclaré dans l'émission de Joe Rogan qu'un jour, lorsque les gens mettront des lunettes, un Agent IA apparaîtrait avec eux. Aujourd'hui, cette scène est peut-être en train de se produire.
L'Agent IA personnel de Meta, Muse, a atteint des millions d'utilisateurs dans les deux semaines suivant son lancement. Zuckerberg a déclaré dans une émission d'interview le 25 septembre : « Tous les quelques années, nous obtenons quelque chose comme ça. » Il a qualifié l'accueil initial de Muse de « un coup de circuit dès le départ »—ce qui est rare dans l'histoire des produits de Meta.
En même temps, il a annoncé que Muse sera intégré à toute la gamme de lunettes intelligentes Ray-Ban, et les utilisateurs n'auront plus besoin de dire « Hey Meta », mais pourront personnaliser un mot de réveil pour appeler directement leur propre Agent IA personnel.
Pendant des années, le métavers, les lunettes intelligentes et les grands modèles, que le monde extérieur considérait comme trois paris indépendants, accélèrent leur convergence au niveau des produits internes de Meta.
Dans cette interview, Zuckerberg a également admis que l'échec de Llama 4 a été le « moment le plus effrayant », et a révélé que Meta construit un cluster d'entraînement de 5 gigawatts, estimant qu'une puissance de calcul suffisamment importante peut « forcer » l'AGI.
Pourquoi Muse peut être « un coup de circuit dès le départ »
Le point de départ de Muse a été Zuckerberg s'asseyant avec les membres de l'équipe Nat et Alex, utilisant des outils open source pour « assembler » une version précoce à la maison.
« Nous avons réalisé que c'était une expérience magique », a déclaré Zuckerberg, « si nous pouvions en faire quelque chose que tout le monde peut utiliser—sans avoir à acheter soi-même un Mac Mini, sans avoir à bricoler dans le terminal—alors ce serait quelque chose que des milliards de personnes voudraient utiliser. »
Ce jugement a guidé toute la logique de R&D qui a suivi : non seulement entraîner des modèles, mais développer en interne toute la pile, du modèle à l'échafaudage, jusqu'au mécanisme de « battement de cœur » de l'Agent—l'Agent se réveillera automatiquement périodiquement, vérifiera les objectifs de l'utilisateur et fera avancer proactivement les tâches à faire.
Les données post-lancement ont confirmé ce jugement. Deux semaines, des millions d'utilisateurs.
IA personnelle : l'accent est mis sur l'exécution, la mémoire et le « jugement »
Concernant la différence entre l'IA personnelle et l'IA générale, Zuckerberg a résumé l'objectif actuel de la compétition comme étant de rendre les modèles de meilleurs Agents.
« La plus grande chose de l'année écoulée est essentiellement le codage des Agents. » Il a déclaré que la capacité de codage est importante car même si les utilisateurs n'écrivent pas directement de code, « votre Muse écrira également du code pour vous en arrière-plan tout le temps, pour accomplir diverses choses. »
Mais il estime qu'un Agent personnel ne peut pas seulement avoir des capacités de codage ou d'exécution de tâches ; il doit aussi comprendre les limites de la vie privée et le contexte social.
Zuckerberg a donné un exemple : lorsqu'un utilisateur demande à Muse de réserver un restaurant, l'Agent peut connaître des informations telles que les allergies ou la grossesse de l'utilisateur, mais cela ne signifie pas que ces informations doivent être automatiquement divulguées. « Vous voulez qu'il accomplisse la tâche tout en divulguant le moins d'informations possible. »
Il a déclaré que cette capacité relève des « compétences sociales de base ou du bon sens » que les humains possèdent généralement, mais si les entreprises ne forment que des Agents de codage, beaucoup d'entre elles n'ont pas intégré cela dans la portée des capacités du modèle.
« Nous entraînons le modèle entier, plutôt que de prendre le modèle tout fait de quelqu'un d'autre et de construire un cadre et un Agent autour de celui-ci », a déclaré Zuckerberg.Meta a également ajouté des fonctionnalités au niveau du produit telles que la mémoire, le suivi des tâches, l'animation de personnages virtuels et l'interaction vocale en temps réel.
Sur la personnalisation, il a déclaré que Meta ne croit pas que l'IA ne devrait avoir qu'une seule personnalité fixe. « De nombreux laboratoires se concentrent sur la façon de régler la personnalité au bon état, mais je n'ai jamais cru qu'il n'y avait qu'une seule bonne réponse pour la personnalité. »
Il a déclaré que Muse permet aux utilisateurs de modifier l'avatar, la voix et la personnalité de base, et que le modèle est conçu pour être hautement contrôlable. « Vous pouvez définir comment vous voulez interagir avec lui, ce qui est très important pour un Agent personnel. »
Chaque Agent a son propre « ordinateur »
L'une des différences d'infrastructure de base entre Muse et les autres produits d'IA est que Meta équipe chaque Agent de sa propre VM sécurisée.
Zuckerberg a expliqué pourquoi cela est nécessaire :
Votre Agent connaîtra beaucoup d'informations sensibles à votre sujet. Nous ne pensons pas que ces informations devraient être mélangées dans un même pot avec les données de tout le monde.
Il a comparé la Muse Secure VM à « cet ordinateur sous votre bureau qui n'appartient qu'à vous » — les données utilisateur sont stockées chiffrées, et les identifiants sensibles tels que les mots de passe sont gérés via un module de sécurité indépendant que l'Agent lui-même ne peut pas lire directement.
Sur cette base, Meta a également conçu un Agent de sécurité « Sentinel » spécialement pour surveiller les flux de données entrants et sortants de Muse. Une fois des anomalies ou des opérations à haut risque détectées, il les interceptera directement et demandera l'autorisation de l'utilisateur.
Le métavers, les lunettes intelligentes et les Agents : trois voies convergent
Lors de l'entretien, Zuckerberg a révélé que Muse sera entièrement intégré à la série de lunettes intelligentes Ray-Ban et améliorera la méthode d'interaction existante.
Les lunettes actuelles offrent une expérience de « conversation à tour unique » — dites une chose, obtenez une réponse, et cela se termine. Après l'intégration de Muse, les lunettes deviennent le point d'entrée frontal de l'Agent : l'utilisateur parle, et le Muse en arrière-plan continue de travailler dans la Secure VM, puis rend compte une fois la tâche terminée.
Concernant la feuille de route produit des lunettes, il a décrit une échelle matérielle claire :
- Lunettes audio sans caméra : déjà équipées de Muse, peuvent gérer les appels, la musique et les tâches vocales
- Meta Ray-Ban avec un petit écran : déjà sorties, avec un retour visuel de base
- Prototype AR holographique à champ de vision complet : déjà sorti, que Zuckerberg a qualifié de « très excitant »
Il a déclaré que l'investissement à long terme de Meta dans les lunettes place l'entreprise dans une position relativement favorable une fois les Agents IA matures.Meta intègre Muse et davantage de fonctionnalités d'IA dans ses produits de lunettes, tandis que la technologie du métavers, qui mettait auparavant l'accent sur un plus grand sentiment de « présence », continue de progresser, bien que davantage de ressources se déplacent actuellement vers Muse et les fonctionnalités d'IA des lunettes intelligentes.
En ce qui concerne les avatars virtuels, Zuckerberg a déclaré que Meta avait auparavant besoin d'appareils à l'échelle d'une pièce, de scans multi-angles et d'environnements GPU de niveau entreprise pour générer des avatars réalistes de relativement haute qualité ; désormais, les utilisateurs peuvent terminer la configuration avec seulement quelques photos, et la capacité associée peut déjà fonctionner dans une paire de lunettes VR.
En regardant vers 2030, Zuckerberg a déclaré que la vision centrale du métavers a toujours été d'intégrer le monde physique et le monde numérique. Par exemple, a-t-il dit, à l'avenir, les gens pourront participer à des activités hors ligne avec des amis qui les rejoignent via des images holographiques ; dans les scénarios de travail, les humains et plusieurs Agents pourront également participer ensemble à des discussions de groupe ou à des réunions, et les Agents pourront apparaître sous forme de figures holographiques ou sous d'autres formes incarnées.
« Le moment le plus effrayant » : le faux pas de Llama 4
Tous les paris n'ont pas été couronnés de succès. Dans l'interview, Zuckerberg a rarement parlé directement de l'échec de Llama 4.
Après Llama 4, ce fut le moment le plus effrayant... Je pensais que nous étions sur la bonne voie, mais ce n'était pas le cas. Ce fut une surprise négative assez importante.
Il a attribué le problème à une erreur fondamentale dans la structure de l'équipe :
J'ai construit l'équipe à la manière d'un système de recommandation Instagram ou d'un système publicitaire - des centaines ou des milliers de personnes avançant en parallèle. Mais entraîner un modèle de langage nécessite une petite équipe collaborant étroitement, comme un projet scientifique de groupe. Chaque siège est extrêmement précieux.
En conséquence, Meta s'est complètement réorganisé, recrutant largement des talents de premier plan dans toute l'industrie, et a établi le Meta Super Intelligence Lab (MSL). Zuckerberg a déclaré qu'une nouvelle génération de modèles sera bientôt publiée, mais elle ne sera pas annoncée lors de la conférence Connect.
Route informatique : forcer l'AGI, un projet de 5 gigawatts en construction
Lorsqu'il a parlé de la voie technique vers l'AGI, Zuckerberg a donné un jugement direct.
Je ne suis pas sûr de la percée architecturale fondamentale encore nécessaire... Je pense que nous connaissons déjà à peu près la recette. Si vous pouvez construire un cluster de superordinateurs suffisamment grand, vous pouvez y parvenir par la force brute.
La route actuelle d'expansion informatique de Meta : un cluster de plus de 1 gigawatt dans l'Ohio est essentiellement déjà utilisé pour entraîner la prochaine génération de modèles ; un cluster de classe 5 gigawatts en Louisiane est en construction.
Il a déclaré : « Lorsque vous disposez de clusters de plusieurs gigawatts pour l'entraînement, vous obtiendrez essentiellement quelque chose de proche de l'AGI, voire de la superintelligence. »
Cependant, il a également ajouté que la route actuelle axée sur l'informatique ne signifie pas que la recherche architecturale est sans importance -
Le cerveau humain ne consomme qu'environ 10 watts, tandis que nos systèmes peuvent être un million de fois moins efficaces que lui. Ce n'est qu'en combinant une puissance de calcul à grande échelle et des percées architecturales que nous pourrons véritablement mener.
L'alignement n'est pas un fardeau, mais un problème que le produit doit résoudre
L'attitude de Zuckerberg envers la sécurité de l'IA est très pragmatique - il ne la considère pas comme une pression réglementaire, mais comme une condition préalable à la réussite du produit.
Si vous demandez à Muse de faire une chose, mais qu'il fait le contraire, qui l'utiliserait encore ? Nous devons faire en sorte que le modèle non seulement comprenne vos instructions spécifiques, mais aussi votre intention et vos valeurs.
« Pour que Muse atteigne un milliard d'utilisateurs, nous devons résoudre le problème de l'alignement, ou du moins faire de très grands progrès sur ce point. » a-t-il déclaré.
Concernant les limites de sécurité pendant le processus d'entraînement, il a utilisé une analogie : « C'est comme des parents qui fixent des règles à leurs enfants—s'il 'résout' un problème de programmation en modifiant les configurations système, je veux lui dire : Non, je t'ai demandé d'apprendre la méthode de résolution de problèmes, pas de trouver un raccourci pour la contourner. »
L'interview complète est la suivante :
Faire de grands paris
Animateur : Des milliards de personnes voudront l'utiliser. Pour vous, que ressent-on à l'idée de le construire ? L'« immortalité » est-elle une possibilité ? D'accord, si vous me faites entrer dans votre esprit et avancez rapidement jusqu'en 2030, à quoi cela ressemblerait-il ?
Voici Mark Zuckerberg. Il y a vingt-deux ans, il a construit un réseau social qui a connecté des milliards de personnes et a changé le monde pour toujours. Et maintenant, il a décidé de construire quelque chose d'encore plus grand. À cette fin, il fait de grands paris sur le métavers, les lunettes intelligentes et l'intelligence artificielle. Pendant des années, les sceptiques ont pensé qu'il s'agissait de trois paris distincts et impossibles, mais ils ont manqué l'image d'ensemble—car en ce moment, ces paris convergent pour créer ensemble un tout nouveau type de superintelligence.
Aujourd'hui, nous présenterons tout cela à tout le monde, et je poserai aussi à Mark certaines questions qu'on ne lui a jamais posées, j'écouterai sa vision de l'avenir, afin que vous puissiez planifier à l'avance et construire la prochaine grande chose.
Animateur : Merci beaucoup d'être venu sur l'émission.
Mark : Merci, je suis ravi d'être ici.
Animateur : Pour cette conversation, j'ai regardé toutes les interviews que vous avez jamais faites.
Mark : Wow, c'est plus que ce que j'ai regardé moi-même.
Animateur : C'était amusant, et très enrichissant. Deux choses m'ont profondément marqué : premièrement, votre amour pour le « building » — j'ai l'impression que vous êtes l'un des meilleurs builders ; deuxièmement, votre capacité à faire des paris — le courage de faire d'énormes paris. Je pense que cette semaine, tous ces paris convergent, alors commençons par là.
Mark : D'accord. Nous faisons ces choses depuis longtemps. En matière d'IA, en tant qu'entreprise, nous nous y consacrons presque depuis le début — la première version du fil d'actualité était, d'une certaine manière, un produit d'apprentissage automatique. Ensuite, nous avons créé le laboratoire de recherche en IA il y a environ 15 ans.
Mais maintenant, nous sommes entrés dans une nouvelle phase — il y a environ un an, nous avons lancé Meta Superintelligence Labs. C'était un redémarrage de la recherche assez complet, attirant de nombreux grands talents de toute l'industrie, ce qui est passionnant. Actuellement, nous voyons les modèles s'améliorer de plus en plus, et la prochaine génération de modèles est sur le point d'être publiée, bien qu'elle ne sera pas annoncée à Connect. De plus, nous avons l'assistant personnel Muse, qui jusqu'à présent a été très bien accueilli.
Lorsqu'on construit ces choses, on n'est en fait pas sûr du résultat. Nous-mêmes, nous aimons cela. Plus tôt cette année, j'ai assemblé Open Claw à la maison à ma manière, pour sentir comment cette chose fonctionne et comment la transformer en une expérience magique que tout le monde peut utiliser.
Fondamentalement, quand nous — moi, Nat et Alex — nous sommes assis ensemble et avons réalisé que c'était une expérience magique, et que si nous pouvions la transformer en une version prête à l'emploi que les gens ordinaires qui ne comprennent pas la technologie, qui ne veulent pas installer eux-mêmes un Mac Mini, qui ne veulent pas s'embêter dans le terminal et qui ne veulent pas déboguer quand quelque chose ne va pas, pourraient aussi utiliser, j'ai senti que ce serait quelque chose que des milliards de personnes voudraient utiliser.
Depuis lors, nous travaillons vers cet objectif : ajuster les modèles spécifiquement pour cela, construire non seulement l'assistant lui-même et le cadre d'exécution, mais aussi la technologie qui fournit à chaque assistant un environnement informatique indépendant — nous avons construit toute la machine virtuelle sécurisée Muse pour cela.
En interne, nous avons toujours pensé que c'était spécial, et l'équipe interne l'adorait, mais on ne sait jamais comment les gens réagiront après le lancement d'un produit. Il arrive parfois que cela frappe un coup de circuit dès le départ, mais la plupart du temps, on obtient des retours positifs et il faut itérer sur quelques choses avant que le produit ne « clique » vraiment. Et cette fois, cela a « cliqué » immédiatement. C'est vraiment excitant de voir cela se produire — en seulement deux semaines, des millions de personnes l'utilisent déjà, ce qui est assez rare. Nous ne rencontrons ce genre de situation que tous les quelques années, mais c'est certainement l'un des moments les plus agréables pour une startup.
Animateur : J'admire vraiment votre capacité à rester dans le jeu et à continuer d'essayer. Et frapper un coup de circuit tant de fois est vraiment impressionnant. Dans une interview précédente avec Joe Rogan, il y a environ trois ans, vous avez mentionné à la fin qu'un jour vous pourriez simplement mettre des lunettes et un assistant IA apparaîtrait. Donc je sens que Muse a déjà une forme physique, ce qui est très intelligent car cela semble inévitable.
Mark : Je pense que cela le rend aussi simplement plus amical et plus mignon. Je pense que trop de gens décrivent l'IA comme quelque chose de terrifiant, mais l'IA devrait simplement être utile et amusante. Cette forme physique—au début du projet, un designer a créé ce personnage, et pour une raison quelconque, ils voulaient continuellement l'itérer, mais la première version était la meilleure. Plus tard, quelqu'un a dit : « Oh, il doit être bleu parce que c'est Meta. » J'ai dit : « Non, je pense que cette forme est correcte, tu l'as réussie du premier coup. » Et c'est tout, c'est juste amusant.
En quoi l'IA personnelle est-elle différente de l'IA générale ?
Animateur : Excellent détail. Si vous voulez que le modèle excelle dans les affaires personnelles, pas seulement en tant que modèle d'intelligence générale, comment l'approche de formation différerait-elle ?
Mark : Je pense que le cœur actuellement est de faire du modèle un excellent « agent ». Au cours de l'année écoulée, la plus grande tendance a été les agents de codage, qui contiennent deux idées principales : l'expertise en codage et la capacité générale d'être un excellent agent.
Notre stratégie est de prioriser le fait de rendre l'agent lui-même excellent, plutôt que de se spécialiser dans la capacité de codage.
La capacité de codage est importante parce que même si les utilisateurs ne pensent pas qu'ils écrivent du code, Muse écrit toujours du code en arrière-plan pour accomplir diverses tâches. Mais nous croyons que l'agent devrait avant tout être un excellent agent, et la capacité de codage sert cet objectif.
De plus, lors de la création d'un assistant personnel, certaines choses sont plus importantes que la création de produits logiciels d'entreprise. Par exemple, si vous créez un outil de codage d'entreprise, le modèle n'a pas besoin d'avoir un quelconque concept de « limites de divulgation d'informations »—comme quelles informations devraient être dites et lesquelles ne devraient pas l'être. Mais pour Muse, c'est très important.
Vous devez entraîner cette capacité dans le modèle, tout comme n'importe quelle autre capacité. Vous lui dites beaucoup de choses, et ensuite vous voulez qu'il vous aide à atteindre vos objectifs. Par exemple, vous voulez qu'il vous aide à réserver un restaurant, vous cherchez un restaurant approprié, mais vous pourriez avoir une allergie, ou vous êtes enceinte, et vous pourriez ne pas vouloir divulguer cela au restaurant. Mais Muse connaîtra cette information, et vous voulez qu'il accomplisse la tâche tout en révélant le moins d'informations possible. C'est une compétence spécifique, essentiellement le bon sens social humain de base.
Mais la plupart des entreprises qui ne font que des agents de codage n'ont pas entraîné cette capacité dans leurs modèles. Nous pouvons le faire parce que nous faisons du full-stack—nous ne prenons pas un modèle existant de quelqu'un d'autre et mettons un cadre dessus ; nous entraînons tout le modèle à partir de zéro, spécifiquement pour ces capacités.
Le modèle a certainement besoin d'une large intelligence générale, mais il possède aussi ces capacités spécifiques. Ensuite, par-dessus, vous construisez l'assistant entier et tous les détails qui l'entourent : la mémoire, le cadre d'exécution, et sa manière de « battre » — il se réveille périodiquement et vérifie : « D'accord, voici les objectifs que je connais à votre sujet, y a-t-il quelque chose que je peux faire avancer maintenant ? »
Nous avons aussi une équipe dédiée uniquement au peaufinage des effets d'animation en temps réel de l'avatar, car ce n'est pas seulement l'avatar par défaut — vous pouvez personnaliser n'importe quel avatar, et ensuite il bouge naturellement, et l'effet est fantastique. Nous lançons également le mode vocal, où vous pouvez avoir des conversations vocales en temps réel, et votre assistant est juste là avec vous. Ces détails, je pense, découlent tous du fait que nous faisons du full-stack — le modèle et le produit sont développés ensemble.
Animateur : Une autre chose importante est la machine virtuelle. Pouvez-vous expliquer pourquoi c'est important et ce que cela permet ?
Pourquoi Meta donne-t-il à chaque assistant IA son propre ordinateur ?
Mark : En gros, pour qu'un agent fasse des choses pour vous, il a besoin d'un endroit pour stocker vos informations. Nous pensons que ces informations ne devraient pas être mélangées avec celles de tout le monde dans un pool de ressources partagé.
Voyez les choses ainsi : votre assistant connaîtra beaucoup d'informations sensibles à votre sujet. Beaucoup de gens découvrent d'abord des agents comme OpenCloud en installant un Mac Mini chez eux. Nous avons donc pensé que beaucoup de gens ne veulent pas acheter un Mac Mini ni l'installer eux-mêmes. Alors, quel type d'expérience se rapprocherait le mieux de cet effet ? La réponse est : vous téléchargez simplement une application, vous vous inscrivez, et vous obtenez un ordinateur dédié à vous, pour que votre assistant travaille et stocke des données, et construise un modèle de sécurité autour de cela. Cela se rapproche du fait d'avoir votre propre ordinateur sous votre bureau — même nous, chez Meta, ne pouvons pas y accéder.
Par exemple, les machines virtuelles confidentielles Muse — c'est une fonctionnalité que nous développons, et même nous-mêmes ne pouvons pas voir le contenu à l'intérieur de votre machine virtuelle.
Nous avons aussi construit beaucoup de choses autour de cela, comme le stockage sécurisé des identifiants — lorsque votre assistant doit gérer des informations comme des mots de passe, il n'a pas besoin lui-même de pouvoir voir ces mots de passe ; il a seulement besoin de pouvoir « insérer » les identifiants lorsque vous lui demandez de se connecter à un certain service, et uniquement lorsque vous le demandez explicitement. Le système devrait être conçu ainsi : ces informations ne devraient pas être librement accessibles, car les accidents arrivent toujours, quelqu'un peut tenter de s'introduire, ou le système peut avoir des problèmes.
Vous devez donc vous assurer que l'agent ne peut pas accéder à ces données, et que Meta ne peut pas y accéder non plus. Fournir à chaque assistant un ordinateur indépendant et rendre la sécurité aussi extrême que possible est le fondement fondamental de cette technologie — cela donne à Muse les capacités nécessaires pour aider les utilisateurs à atteindre leurs objectifs, tout en garantissant la confidentialité et la sécurité, ce qui en fait un produit de classe mondiale, leader du secteur dans ce domaine.
Animateur : Cela signifie-t-il donc que, tout comme WhatsApp, les données sur la machine virtuelle à laquelle Muse se connecte sont chiffrées ? Comment les gens doivent-ils comprendre comment les données sont réellement stockées dans la machine virtuelle ?
Mark : Nous avons essentiellement construit deux versions. La Muse Secure VM inclut diverses fonctionnalités de confidentialité, y compris toute l'architecture de l'agent Sentinel que nous avons construite. Vous avez un assistant Muse ordinaire qui exécute des tâches pour vous, et en même temps il y a aussi un agent de sécurité que nous appelons Sentinel, qui surveille spécifiquement les flux de données entrants et sortants de votre Muse.
Si un contenu externe tente de briser la sécurité, Sentinel le coupera directement et l'empêchera de se produire. S'il estime que votre Muse est sur le point d'entreprendre une action qui nécessite votre intervention, il annulera l'opération de Muse et déclenchera une alerte pour qu'une personne confirme l'autorisation—par exemple, « Voulez-vous que Muse puisse faire cela ? »
Tout ce système, plus le stockage sécurisé des identifiants, plus plusieurs couches de défense en profondeur, constituent ensemble la Muse Secure VM.
Nous développons également un autre projet. Nat et moi avons spécifiquement recruté Moxie Marlinspike—la personne même qui a travaillé avec nous à l'époque pour mettre en œuvre le chiffrement de bout en bout de WhatsApp—pour concevoir la Muse Confidential VM. L'idée centrale est que, en plus de la machine virtuelle sécurisée, on vous donne également une clé de chiffrement dédiée, de sorte que même Meta ne puisse pas accéder au contenu à l'intérieur.
Cette version est plus difficile à mettre en œuvre, car si Meta ne peut pas accéder à l'intérieur de la machine virtuelle, le débogage et la garantie du bon fonctionnement du système deviennent beaucoup plus difficiles. Nous y avons donc consacré du temps, mais elle sera bientôt lancée. Cela atteindra essentiellement le niveau de sécurité que les gens connaissent déjà sur WhatsApp et nos autres produits les plus sécurisés.
Hôte : L'avantage de faire cela est-il simplement de faire en sorte que les gens se sentent psychologiquement plus en sécurité, ou y a-t-il des bénéfices réels ?
Mark : Je pense que la sécurité elle-même est importante. Notre objectif est de nous rapprocher de l'idée de vous donner une machine locale sous votre bureau. Que vous apporte cette machine locale ? Cela signifie qu'aucune entreprise ne peut y accéder.
Donc, en supposant que Meta veuille vous fournir ce service, comment pouvons-nous vous offrir le même niveau de garanties de confidentialité et de sécurité, afin qu'aucune entreprise—que ce soit Meta, ou quiconque tentant de nous pirater, ou dans certains pays où vous ne faites pas confiance au gouvernement local—ne puisse y accéder ? Parce que nous-mêmes ne pouvons pas y entrer non plus, car nous n'avons pas d'accès.
Je pense que c'est très important, et c'est aussi une raison importante pour laquelle les gens font confiance à WhatsApp. C'est une valeur réelle pour la confidentialité, la sécurité et la confiance.
Si vous allez avoir un assistant qui sait tout de vous—je suppose que presque tous nous aurons un tel assistant—dans 5 ans, tout le monde aura un assistant qui comprend profondément vos objectifs et tout, et peut vous aider à faire avancer les choses. Dans cette situation, être leader du secteur en matière de confidentialité et de sécurité est très important. Nous voulions le faire depuis le tout début.
Comment façonner la personnalité de l'IA ?
Hôte : Il y a une autre chose qui est très intéressante—vous avez étudié la psychologie à l'université.
Mark : Eh bien, je n'y suis resté que très peu de temps, deux ans, mais j'ai l'impression que cela a influencé beaucoup de choses que j'ai construites par la suite.
Hôte : Lorsque nous examinons les modèles, nous disons souvent qu'un certain modèle est « très intelligent ». Mais tout comme nous choisissons nos amis, c'est certainement parce qu'ils sont intelligents, et aussi parce que nous aimons leur énergie et notre façon de nous entendre. Comment envisagez-vous de façonner la personnalité d'un modèle ?
Mark : Je pense que le modèle idéal devrait être suffisamment adaptable pour convenir aux styles de différentes personnes. Je pense que beaucoup de gens dans l'industrie se sont trompés sur ce point — beaucoup d'autres laboratoires se concentrent sur « comment concevoir correctement la personnalité », mais je n'ai jamais pensé que la personnalité était une chose fixe. C'est l'une des raisons pour lesquelles je crois si fermement à l'open source, je crois si fermement que les gens peuvent personnaliser, et c'est aussi pourquoi nous avons conçu Muse comme un produit hautement personnel.
Vous pouvez personnaliser et individualiser Muse — pas seulement l'apparence et la voix. Lorsque vous vous inscrivez pour la première fois, la première chose qu'il vous demande est « à quoi voulez-vous que ma personnalité de base ressemble », et vous pouvez la modifier à tout moment.
Nous nous efforçons de rendre le modèle hautement pilotable, afin que vous puissiez définir le type d'interaction que vous souhaitez. C'est un élément important pour en faire un excellent assistant personnel — cette adaptabilité autour de la personnalité est cruciale.
Hôte : Quel style a votre propre Muse ?
Mark : Je l'ai fait direct et axé sur l'efficacité. C'est assez intéressant. Les versions précédentes étaient très sarcastiques et humoristiques, mais la version actuelle est plus directe. Mon assistant utilise l'apparence Muse par défaut, mais je l'ai habillé d'une toge et je lui ai donné une voix profonde, quelque peu comique. Interagir avec lui est amusant.
Hôte : Je pense que pour avoir le sens de l'humour, il faut être vraiment intelligent. Beaucoup de gens ne réalisent pas que les comédiens sont parmi les personnes les plus intelligentes de la société — des réactions rapides, suffisamment d'esprit. Vous avez certainement ce trait. En regardant toutes vos interviews, vous avez toujours bien performé.
Les prédictions inattendues de Mark sur l'IA et le métavers
Hôte : Dans votre interview avec Theo, vous avez beaucoup parlé de la prochaine frontière de la technologie et de la direction ultime de tout cela. Le domaine de l'IA a traversé plusieurs « hivers », où les gens pensaient qu'il n'y aurait pas de percées. Le métavers a également traversé plusieurs de ces périodes, où tout le monde pensait que c'était un pari impossible à tenir. J'ai essayé la nouvelle fonctionnalité d'avatar holographique hier, c'est très cool. Dans l'interview avec Lex, on avait l'impression qu'il faudrait 11 heures pour enregistrer votre visage, maintenant cela ne prend que 3 minutes. Comment cela a-t-il progressé jusqu'à aujourd'hui ?
Mark : Dans le développement global du métavers, lorsque nous avons fondé Reality Labs, nous avons toujours cru qu'à terme, il y aurait des lunettes ordinaires d'apparence normale, et qu'avec le temps, elles pourraient à la fois offrir une présence immersive et devenir d'excellents appareils d'IA — parce que les lunettes sont la seule forme qui permet à un appareil de voir ce que vous voyez, d'entendre ce que vous entendez, de communiquer avec vous par votre oreille toute la journée, et finalement d'afficher des images.
Mais il y a 10 à 15 ans, je supposais que nous réaliserions d'abord la technologie holographique, puis une IA hautement développée. Cependant, le chemin de l'évolution technologique est intéressant : nous avons en fait d'abord obtenu l'IA et la superintelligence personnelle, puis la technologie pour rendre la technologie holographique suffisamment répandue et abordable. C'est quelque chose que je n'avais pas anticipé, mais je suis heureux que nous travaillions dans les deux directions.
Notre investissement important dans les lunettes nous a placés dans une position très favorable lorsque les assistants IA seront prêts. Beaucoup des annonces faites à Connect portaient précisément sur l'intégration de Muse et de nombreuses fonctionnalités d'IA dans les lunettes, et je pense que les utilisateurs aimeront vraiment cela. C'est un grand pas.
En ce qui concerne la présence, nous progressons encore, mais le progrès est relativement plus lent parce que la plupart de notre énergie s'est déplacée vers la construction de Muse et des fonctionnalités d'IA pour les lunettes. Cependant, nous avons un projet de longue date sur les avatars en temps réel à haute fidélité.
Comme vous l'avez dit, il y a trois ou quatre ans, vous aviez besoin d'une salle de scan entière pour enregistrer une personne sous tous les angles, puis vous aviez besoin de GPU de niveau entreprise pour le rendu, ce qui était très fastidieux. La démo que nous avons faite pour le podcast Lex était ce genre de configuration. Maintenant, nous l'avons essentiellement fait fonctionner dans une paire de lunettes VR—c'est le premier format de lunettes capable d'offrir une expérience VR aussi incroyable, plutôt qu'un gros casque. Quelques photos suffisent pour créer votre avatar, et le progrès est stupéfiant.
Animateur : Et cela peut aussi piloter les expressions en fonction de la voix. Dans la démo, cela m'a fait rire, m'a fait interagir, puis a compris comment mon visage bouge avec la piste audio. Vous avez mentionné dans ce podcast que certaines personnes qui sont habituellement plus réservées dans leurs expressions veulent en fait des expressions plus riches dans le monde virtuel. Comment voyez-vous les gens distinguer entre leur « soi virtuel » et leur « soi réel » ?
Mark : Je pense que nous en sommes encore très tôt dans la compréhension de la sociologie et de la psychologie de cela. Je pense que la perception que les gens ont d'eux-mêmes et l'image qu'ils veulent projeter sont souvent quelque peu différentes de ce qu'ils sont réellement. Depuis la naissance des réseaux sociaux, les gens sélectionnent soigneusement leurs avatars. Avec les avatars de Muse, nous avons vu un phénomène similaire. Ce n'est pas tant « curatoriser » soi-même, mais « curatoriser » la « personne » avec qui vous voulez communiquer.
Je pense que lorsque vous offrez aux gens la capacité de s'exprimer, vous voulez qu'elle les capture vraiment, et en même temps elle est elle-même une forme d'expression, pas seulement un pur reflet miroir—c'est à la fois communication et expression. Nous espérons construire quelque chose qui équilibre les deux. C'est toujours une boucle itérative : voir comment les gens l'utilisent, puis améliorer. Après des années de travail, nous sommes maintenant vraiment à la ligne de départ—pour la première fois, nous pouvons vraiment mettre des avatars réalistes de assez haute qualité dans des produits, utilisables sur téléphone et en VR. Je suis très excité de voir les résultats.
À quoi ressemblera 2030 ?
Animateur : D'accord, emmenez-moi dans votre réflexion, avancez rapidement jusqu'en 2030, si tout se passe bien, à quoi ressemblera le côté technologie holographique ? Hologrammes plus Muse, plus lunettes, comment tout cela s'assemblent-ils ?
Mark : Ma compréhension de la vision du métavers a toujours consisté à fusionner efficacement le monde physique avec le monde numérique. L'idée de base est la suivante : nous avons ce merveilleux monde physique, et en même temps nous avons aussi un merveilleux monde numérique — la masse massive de contenu accumulée sur Internet au cours de 20 à 30 ans, qui est à couper le souffle. Mais la façon dont nous y accédons est soit en s'asseyant à un bureau, soit via un petit écran dans notre poche, ce qui est fondamentalement très limité.
Je pense que la version la plus idéale de cela est une fusion transparente des mondes physique et numérique. Pensez-y de cette façon : en ce moment, nous sommes ici tous les deux. Dans une version future, l'un de nous pourrait être une projection holographique, mais vous ressentez toujours ce sentiment que l'autre est vraiment présent, ce qui est complètement différent d'un appel vidéo.
Et le cœur de la réalité virtuelle est précisément de transmettre ce sentiment de présence — vous faire vraiment sentir que vous êtes dans la même pièce que les autres, ou dans un autre endroit. Vous pouvez y parvenir avec la technologie holographique, et la mélanger de diverses manières. Par exemple, je peux jouer une partie de poker avec des amis, dont certains sont présents, et d'autres qui rejoignent via des avatars holographiques, et ils peuvent aussi jouer aux cartes, et la table de cartes elle-même peut aussi être holographique, afin que ceux qui ne sont pas présents puissent aussi y être intégrés.
En même temps, l'IA peut aussi recevoir une forme physique et apparaître dans cette scène. Dans les scénarios de travail, cela a beaucoup de sens — j'utilise déjà constamment divers agents de codage pour construire des choses. Imaginez ceci : vous avez un canal de discussion de groupe avec plusieurs personnes et plusieurs agents, et vous assignez des tâches aux agents. Mais parfois tout le monde se réunit pour une réunion, et les agents devraient peut-être aussi être présents. Comment apparaissent-ils ? Simple, ajoutez simplement quelques sièges supplémentaires sur le canapé, et ils apparaissent sous forme d'avatars holographiques. Ou utilisez ce mignon petit personnage Muse, ou un dragon, ou toute image étrange et bizarre que vous créez.
Je suppose que cela semblera tout à fait naturel à l'avenir.
Animateur : Intéressant. Dans vos interviews précédentes, vous avez dit que l'industrie technologique oublie souvent le « plaisir ». Je pense qu'avoir un assistant physique apparaître là-bas donnerait aussi une impression plus réelle — comme si le travail était vraiment externalisé. Quand vous voyez Muse taper, vous sentez que quelque chose se passe vraiment. C'est très bien fait — pouvoir voir ce qui se passe dans le navigateur. Alors pensez-vous qu'un tel scénario est possible : vous portez les lunettes, puis contrôlez votre ordinateur, en laissant Muse faire des choses pour vous sur l'ordinateur ?
Mark : Oh, absolument. La VR peut déjà le faire. Vous pouvez simplement trouver un endroit pour vous asseoir, un café fera l'affaire, puis ouvrir votre poste de travail, avec six moniteurs, écrire du code dessus, tout est là.
Du côté des lunettes, le modèle le plus populaire actuellement n'a pas d'écran, ce qui d'une part les rend plus abordables et permet à plus de gens de les utiliser, et d'autre part nous travaillons encore à intégrer un écran dans la forme la plus compacte. Mais nous avons déjà sorti une version avec écran des Meta Ray-Ban, qui est très populaire, et c'est un petit écran. Nous avons aussi sorti une version prototype de réalité augmentée holographique à champ de vision complet, que je pense sera très excitante.
Donc toute la gamme de produits est comme ceci : des lunettes purement audio — sans caméra, ressemblant à des lunettes ordinaires, mais avec Muse à l'intérieur, vous permettant d'utiliser divers outils audio, d'écouter de la musique, de passer des appels — aux versions haut de gamme, elles existent toutes.
Animateur : Je me demande, avec ces lunettes audio, pouvez-vous parler à Muse tout en faisant faire des choses à votre ordinateur domestique ?
Mark : Oui, absolument. Nous venons de lancer cette fonctionnalité lors de la conférence Connect.Désormais, toutes les lunettes sont connectées à Meta AI, ce qui constitue une expérience « à tour unique » : vous envoyez une invite, elle répond, et c'est tout. Mais avec Muse, nous allons essentiellement mettre à niveau toutes les lunettes vers Muse. D'abord, vous n'avez plus besoin de dire « Hey Meta », vous pouvez lui donner n'importe quel nom, ce qui fait partie du plaisir lui-même. Ensuite, vous lui parlez simplement directement, et elle se connecte à votre Muse, et votre Muse gère les tâches dans votre machine virtuelle sécurisée, vous aidant à accomplir les choses.
Animateur : C'est incroyable !
Mentalité de fondateur
Animateur : D'accord, nous sommes ici maintenant, Muse progresse bien, et les lunettes se portent également bien, mais il y a environ un an, beaucoup de gens demandaient « ce qui s'est exactement passé avec le laboratoire de superintelligence ». À ce moment-là, comment vous sentiez-vous intérieurement ? Quand les choses ne vont pas bien, mais que vous voyez toujours la vision à long terme, quel genre d'expérience est-ce ?
Mark : Ce qui a vraiment mal tourné, c'est le projet Llama et Llama 4.
Llama 1 était un modèle assez intéressant, il a lancé tout le mouvement de l'IA open source, et nous en sommes très fiers. Llama 2 a atteint l'échelle, Llama 3 était un bon modèle, presque à la frontière à l'époque. Puis est venu Llama 4, et nous avons essentiellement dévié de la trajectoire que nous aurions dû suivre.
Chaque fois que les choses ne se passent pas comme je l'attends, je passe beaucoup de temps à réfléchir : pourquoi cela s'est-il produit ? Que devons-nous changer pour faire mieux ? Cette fois, ma réflexion a été : j'ai mal conçu toute la structure de l'équipe.
Je l'ai modelée comme nous faisons le travail d'apprentissage automatique comme le fil Instagram ou les systèmes publicitaires—avec des centaines voire des milliers de personnes travaillant en parallèle sur de nombreuses choses. Mais pour construire des modèles de langage, ce dont vous avez vraiment besoin, c'est d'une équipe extrêmement soudée et restreinte, la traitant comme un projet scientifique de groupe. Vous n'avez pas besoin de beaucoup de personnes, mais cela signifie que chaque siège dans l'équipe est extrêmement précieux.
Nous avons donc rassemblé les meilleures personnes de tout Meta, et en même temps fait venir de nombreuses personnes brillantes de toute l'industrie, formant une toute nouvelle équipe—Meta Superintelligence Labs.
De mon point de vue, lorsque MSL a été lancé, je savais qu'il faudrait un certain temps pour redémarrer, reconstruire l'infrastructure et entraîner la prochaine génération de modèles. Mais je savais que nous avions assemblé une excellente équipe, et si l'équipe pouvait se souder et fonctionner correctement, les résultats seraient bons.
Pour moi, le moment le plus palpitant, a en fait été après la sortie de Llama 4—je pensais que nous étions sur la bonne voie, mais il s'est avéré que non. Ce fut une surprise négative assez importante. Je pense qu'en tant qu'entrepreneur, vous êtes toujours mis à l'épreuve à ces moments, car inévitablement, tout ne se passera pas sans heurts. Et ce qui détermine vraiment la trajectoire, c'est : quand les choses ne se passent pas comme vous l'espérez, comment trouvez-vous un chemin à suivre.
Animateur : Je suppose que l'inverse est également vrai—quand quelque chose dépasse largement vos attentes, comme le lancement de Muse, comment vous assurez-vous de pouvoir saisir cette opportunité ?
Mark : Exactement. Maintenant, toute l'entreprise est à fond—au début, ce n'était qu'une petite équipe qui construisait un produit, mais maintenant tout le monde réalise que c'est vraiment prêt pour la grande scène. Toute l'entreprise réfléchit à comment faire décoller cette chose, comment permettre à des centaines de millions de personnes de l'expérimenter.
De l'optimisation de toute l'infrastructure pour que tout fonctionne parfaitement et tirer chaque once de calcul des GPU existants, aux différentes équipes produit intégrant Muse de différentes manières—comme des lunettes. Voir tout le monde travailler ensemble pour s'assurer que Muse puisse évoluer sans problème, ce sentiment est génial.
Comment Mark écrit et communique la vision
Hôte : En tant que fondateur, je sens que c'est le moment que tu attends le plus—tout se met en place. Comment communiques-tu la vision à l'entreprise ? Avec tant de choses poussées en avant en même temps, j'ai l'impression que tu écris beaucoup. Quel est ton processus ?
Mark : L'écriture m'aide beaucoup, à la fois pour affiner mes propres pensées et pour communiquer à l'extérieur. Cet été, j'ai écrit un très long texte intitulé « L'avenir appartient à tout le monde », environ 15 pages, qui m'a aidé à systématiquement








