Zuckerberg über Muse: Der Durchbruch der KI-Agenten – Metas drei große Wetten verschmelzen

KI-AgentLlama 4MetaMuseSmart GlassesAGIMetaversum
vor 1 StundeQuelle: blockweeks.com
Zuckerberg über Muse: Der Durchbruch der KI-Agenten – Metas drei große Wetten verschmelzen

Autor: Long Yue, Wallstreetcn

Vor drei Jahren sagte Meta-CEO Zuckerberg in der Joe-Rogan-Show, dass eines Tages, wenn Menschen eine Brille aufsetzen, ein KI-Agent mit ihnen erscheinen würde. Jetzt könnte sich diese Szene abspielen.

Metas persönlicher KI-Agent, Muse, erreichte innerhalb von zwei Wochen nach dem Start Millionen von Nutzern. Zuckerberg sagte in einem Interviewprogramm am 25. September: „Alle paar Jahre bekommen wir so etwas.“ Er charakterisierte die frühe Aufnahme von Muse als „einen Home Run gleich zu Beginn“ – was in der Produktgeschichte von Meta selten ist.

Gleichzeitig kündigte er an, dass Muse in die gesamte Produktlinie der Ray-Ban Smart Glasses integriert wird, und Nutzer müssen nicht mehr „Hey Meta“ sagen, sondern können ein benutzerdefiniertes Weckwort festlegen, um direkt ihren eigenen persönlichen KI-Agenten aufzurufen.

Jahrelang beschleunigen das Metaverse, Smart Glasses und große Modelle, die die Außenwelt als drei unabhängige Wetten betrachtete, ihre Konvergenz auf der internen Produktebene von Meta.

In diesem Interview gab Zuckerberg auch zu, dass das Scheitern von Llama 4 der „beängstigendste Moment“ war, und enthüllte, dass Meta einen 5-Gigawatt-Trainingscluster aufbaut und glaubt, dass ausreichend große Rechenleistung AGI „brute-forcen“ kann.

Zuckerberg spricht über Muse: KI-Agent explodiert, 'Metaverse, Smart Glasses und große Modelle' drei große Wetten vollenden ihre Konvergenz

Warum Muse „ein Home Run gleich zu Beginn“ sein kann

Muses Ausgangspunkt war, dass Zuckerberg sich mit den Teammitgliedern Nat und Alex zusammensetzte und mit Open-Source-Tools zu Hause eine frühe Version „zusammenbastelte“.

„Wir erkannten, dass dies eine magische Erfahrung war“, sagte Zuckerberg, „wenn wir es zu etwas machen könnten, das jeder nutzen kann – ohne sich selbst einen Mac Mini kaufen zu müssen, ohne im Terminal herumzubasteln – dann wäre dies etwas, das Milliarden von Menschen nutzen wollen würden.“

Diese Einschätzung trieb die gesamte nachfolgende F&E-Logik voran: nicht nur Modelle zu trainieren, sondern Full-Stack-Eigenentwicklung vom Modell über das Scaffolding bis zum „Herzschlag“-Mechanismus des Agenten – der Agent wird automatisch regelmäßig aufwachen, die Ziele des Nutzers überprüfen und To-dos proaktiv vorantreiben.

Die Daten nach dem Start bestätigten diese Einschätzung. Zwei Wochen, Millionen von Nutzern.

Persönliche KI: Der Fokus liegt auf Ausführung, Gedächtnis und „Urteilsvermögen“

In Bezug auf den Unterschied zwischen persönlicher KI und allgemeiner KI fasste Zuckerberg den aktuellen Wettbewerbsschwerpunkt damit zusammen, Modelle zu besseren Agenten zu machen.

„Das größte Ding im letzten Jahr ist im Grunde das Codieren von Agenten.“ Er sagte, die Codierungsfähigkeit sei wichtig, denn selbst wenn Benutzer nicht direkt Code schreiben, „wird Ihre Muse ständig im Hintergrund Code für Sie schreiben, um verschiedene Dinge zu erledigen.“

Aber er glaubt, dass ein persönlicher Agent nicht nur über Codierungs- oder Aufgabenausführungsfähigkeiten verfügen darf; er muss auch Privatsphärengrenzen und sozialen Kontext verstehen.

Zuckerberg gab ein Beispiel: Wenn ein Benutzer Muse bittet, ein Restaurant zu buchen, kennt der Agent möglicherweise Informationen wie Allergien oder Schwangerschaft des Benutzers, aber das bedeutet nicht, dass diese Informationen automatisch offengelegt werden sollten. „Sie möchten, dass es die Aufgabe erledigt und dabei so wenig Informationen wie möglich preisgibt.“

Er sagte, diese Fähigkeit gehöre zu den „grundlegenden sozialen Fähigkeiten oder dem gesunden Menschenverstand“, die Menschen normalerweise besitzen, aber wenn Unternehmen nur Codierungsagenten trainieren, haben viele von ihnen dies nicht in den Fähigkeitsbereich des Modells aufgenommen.

„Wir trainieren das gesamte Modell, anstatt das fertige Modell eines anderen zu nehmen und darum herum ein Framework und einen Agenten zu bauen“, sagte Zuckerberg.Meta hat auf Produktebene auch Funktionen wie Gedächtnis, Aufgabenverfolgung, Animation virtueller Charaktere und Echtzeit-Sprachinteraktion hinzugefügt.

Zur Personalisierung sagte er, Meta glaube nicht, dass KI nur eine feste Persönlichkeit haben sollte. „Viele Labore konzentrieren sich darauf, wie man die Persönlichkeit auf den richtigen Zustand einstellt, aber ich habe nie geglaubt, dass es nur eine richtige Antwort für die Persönlichkeit gibt.“

Er sagte, Muse ermögliche es Benutzern, den Avatar, die Stimme und die grundlegende Persönlichkeit zu ändern, und das Modell sei so konzipiert, dass es hochgradig kontrollierbar ist. „Sie können definieren, wie Sie mit ihm interagieren möchten, was für einen persönlichen Agenten sehr wichtig ist.“

Jeder Agent hat seinen eigenen „Computer“

Einer der zentralen Infrastrukturunterschiede zwischen Muse und anderen KI-Produkten besteht darin, dass Meta jeden Agenten mit einer eigenen Secure VM ausstattet.

Zuckerberg erklärte, warum dies notwendig ist:

Dein Agent wird viele sensible Informationen über dich wissen. Wir glauben nicht, dass diese Informationen mit den Daten aller anderen in einem gemeinsamen Pool vermischt werden sollten.

Er verglich die Muse Secure VM mit „dem Computer unter deinem Schreibtisch, der nur dir gehört“ – Benutzerdaten werden verschlüsselt gespeichert, und sensible Anmeldedaten wie Passwörter werden über ein unabhängiges Sicherheitsmodul verwaltet, auf das der Agent selbst nicht direkt zugreifen kann.

Auf dieser Grundlage hat Meta außerdem einen „Sentinel“-Sicherheits-Agenten entwickelt, der speziell die Datenströme in und aus Muse überwacht. Sobald Anomalien oder risikoreiche Vorgänge erkannt werden, werden sie direkt abgefangen und der Benutzer wird zur Autorisierung aufgefordert.

Das Metaverse, intelligente Brillen und Agenten: drei Wege laufen zusammen

In dem Interview verriet Zuckerberg, dass Muse vollständig in die intelligenten Brillen der Ray-Ban-Serie integriert wird und die bestehende Interaktionsmethode verbessern soll.

Die aktuellen Brillen bieten ein „Einzelgespräch“-Erlebnis – man sagt eine Sache, bekommt eine Antwort, und damit ist es beendet. Nach der Integration von Muse wird die Brille zum Frontend-Einstiegspunkt für den Agenten: Der Benutzer spricht, und das Backend-Muse arbeitet in der Secure VM weiter und meldet sich dann zurück, sobald die Aufgabe abgeschlossen ist.

Bezüglich der Produkt-Roadmap für die Brillen beschrieb er eine klare Hardware-Stufenleiter:

  • Kamerafreie Audio-only-Brillen: bereits mit Muse ausgestattet, können Anrufe, Musik und Sprachaufgaben bewältigen
  • Meta Ray-Ban mit einem kleinen Display: bereits veröffentlicht, mit grundlegendem visuellem Feedback
  • Holografischer AR-Prototyp mit vollem Sichtfeld: bereits veröffentlicht, den Zuckerberg als „sehr aufregend“ bezeichnete

Er sagte, Metas langfristige Investitionen in Brillen bringen das Unternehmen in eine relativ vorteilhafte Position, sobald KI-Agenten ausgereift sind.Meta bringt Muse und weitere KI-Funktionen in seine Brillenprodukte, während die Metaverse-Technologie, die zuvor ein stärkeres Gefühl von „Präsenz“ betonte, weiter voranschreitet, obwohl derzeit mehr Ressourcen in Richtung Muse und die KI-Funktionen intelligenter Brillen verschoben werden.

Was virtuelle Avatare betrifft, sagte Zuckerberg, Meta habe zuvor raumgroße Geräte, Mehrwinkel-Scans und GPU-Umgebungen in Unternehmensqualität benötigt, um relativ hochwertige realistische Avatare zu erzeugen; jetzt können Benutzer die Einrichtung mit nur wenigen Fotos abschließen, und die entsprechende Fähigkeit kann bereits in einer VR-Brille ausgeführt werden.

Mit Blick auf das Jahr 2030 sagte Zuckerberg, dass die Kernvision des Metaverse schon immer darin bestand, die physische Welt und die digitale Welt zu integrieren. Zum Beispiel, so sagte er, können Menschen in Zukunft offline gemeinsam mit Freunden an Aktivitäten teilnehmen, die über holografische Bilder beitreten; in Arbeitsszenarien können Menschen und mehrere Agenten auch gemeinsam an Gruppenchats oder Meetings teilnehmen, und Agenten können als holografische Figuren oder in anderen verkörperten Formen erscheinen.

"Der erschreckendste Moment": Llama 4s Fehltritt

Nicht alle Wetten sind reibungslos aufgegangen. Im Interview sprach Zuckerberg selten direkt über das Scheitern von Llama 4.

Nach Llama 4 war das der erschreckendste Moment... Ich dachte, wir wären auf Kurs, aber das waren wir nicht. Es war eine ziemlich große negative Überraschung.

Er führte das Problem auf einen grundlegenden Fehler in der Teamstruktur zurück:

Ich habe das Team nach der Art eines Instagram-Empfehlungssystems oder eines Werbesystems aufgebaut – Hunderte oder Tausende von Menschen, die parallel voranschreiten. Aber das Training eines Sprachmodells erfordert ein eng zusammenarbeitendes kleines Team, das es als ein gemeinsames wissenschaftliches Projekt durchführt. Jeder Platz ist extrem wertvoll.

Infolgedessen hat Meta vollständig umstrukturiert, umfassend Top-Talente aus der gesamten Branche eingebracht und das Meta Super Intelligence Lab (MSL) gegründet. Zuckerberg sagte, dass eine neue Generation von Modellen bald veröffentlicht wird, aber sie wird nicht auf der Connect-Konferenz angekündigt.

Rechenroute: Brute-Forcing AGI, 5-Gigawatt-Projekt im Bau

Als er über den technischen Weg zu AGI sprach, gab Zuckerberg ein direktes Urteil ab.

Ich bin nicht sicher, welcher grundlegende architektonische Durchbruch noch nötig ist... Ich denke, wir kennen das Rezept bereits ungefähr. Wenn man einen ausreichend großen Supercomputer-Cluster bauen kann, kann man sich den Weg dorthin erzwingen.

Metas aktuelle Rechenerweiterungsroute: ein Cluster mit mehr als 1 Gigawatt in Ohio wird im Grunde bereits für das Training der nächsten Modellgeneration genutzt; ein Cluster der 5-Gigawatt-Klasse in Louisiana befindet sich im Bau.

Er sagte: "Wenn man Multi-Gigawatt-Cluster für das Training hat, wird man im Grunde etwas bekommen, das nahe an AGI oder sogar Superintelligenz heranreicht."

Er fügte jedoch hinzu, dass die derzeitige rechengetriebene Route nicht bedeutet, dass Architekturforschung unwichtig ist –

Das menschliche Gehirn verbraucht nur etwa 10 Watt, während unsere Systeme möglicherweise eine Million Mal weniger effizient sind als es. Nur durch die Kombination von großer Rechenleistung und architektonischen Durchbrüchen können wir wirklich führen.

Alignment ist keine Bürde, sondern ein Problem, das das Produkt lösen muss

Zuckerbergs Haltung zur KI-Sicherheit ist sehr pragmatisch – er betrachtet sie nicht als regulatorischen Druck, sondern als Voraussetzung dafür, ob das Produkt erfolgreich sein kann.

Wenn Sie Muse bitten, eine Sache zu tun, aber es das Gegenteil tut, wer würde es dann noch benutzen? Wir müssen dafür sorgen, dass das Modell nicht nur Ihre spezifischen Anweisungen versteht, sondern auch Ihre Absicht und Ihre Werte.

„Damit Muse eine Milliarde Nutzer erreicht, müssen wir das Alignment-Problem lösen oder zumindest sehr große Fortschritte dabei erzielen.“ sagte er.

Bezüglich der Sicherheitsgrenzen während des Trainingsprozesses verwendete er eine Analogie: „Es ist, als ob Eltern Regeln für ihre Kinder aufstellen – wenn es eine Programmieraufgabe ‚löst‘, indem es Systemkonfigurationen ändert, möchte ich ihm sagen: Nein, ich habe dich gebeten, die Problemlösungsmethode zu lernen, nicht einen Abkürzung zu finden, um sie zu umgehen.“

Zuckerberg spricht über Muse: KI-Agent explodiert, ‚Metaverse, smarte Brillen und große Modelle‘ drei große Wetten vollenden ihre Überschneidung

Das vollständige Interview lautet wie folgt:

Große Wetten eingehen

Moderator: Milliarden von Menschen werden dies nutzen wollen. Wie fühlt es sich für Sie an, es zu bauen? Ist ‚Unsterblichkeit‘ eine Möglichkeit? Okay, wenn Sie mich in Ihren Gedanken mitnehmen und bis 2030 vorspulen, wie würde das aussehen?

Das ist Mark Zuckerberg. Vor zweiundzwanzig Jahren baute er ein soziales Netzwerk auf, das Milliarden von Menschen verband und die Welt für immer veränderte. Und jetzt hat er beschlossen, etwas noch Größeres zu bauen. Zu diesem Zweck geht er große Wetten im Metaverse, bei smarten Brillen und bei künstlicher Intelligenz ein. Jahrelang hielten Skeptiker dies für drei separate, unmögliche Wetten, aber sie übersahen das größere Bild – denn genau jetzt konvergieren diese Wetten, um gemeinsam eine brandneue Art von Superintelligenz zu schaffen.

Heute werden wir all dies allen präsentieren, und ich werde Mark auch einige Fragen stellen, die ihm noch nie gestellt wurden, und seiner Vision für die Zukunft zuhören, damit Sie vorausplanen und das nächste große Ding bauen können.

Gastgeber: Vielen Dank, dass Sie in der Sendung zu Gast sind.

Mark: Danke, ich freue mich, hier zu sein.

Gastgeber: Für dieses Gespräch habe ich mir jedes Interview angesehen, das Sie je gegeben haben.

Mark: Wow, das ist mehr, als ich selbst gesehen habe.

Gastgeber: Es hat Spaß gemacht und war sehr bereichernd. Zwei Dinge haben einen tiefen Eindruck bei mir hinterlassen: Erstens, Ihre Liebe zum „Bauen“ – ich habe das Gefühl, Sie sind einer der besten Builder; zweitens, Ihre Fähigkeit, Wetten einzugehen – der Mut, riesige Wetten einzugehen. Ich denke, diese Woche laufen all diese Wetten zusammen, also fangen wir dort an.

Mark: Okay. Wir machen diese Dinge schon seit Langem. Was KI betrifft, haben wir als Unternehmen fast von Anfang an daran gearbeitet – die erste Version des News Feeds war in gewisser Weise ein Produkt des maschinellen Lernens. Dann haben wir vor etwa 15 Jahren das KI-Forschungslabor gegründet.

Aber jetzt sind wir in eine neue Phase eingetreten – vor etwa einem Jahr haben wir Meta Superintelligence Labs gegründet. Es war ein ziemlich gründlicher Forschungsneustart, bei dem wir viele großartige Talente aus der gesamten Branche zusammengebracht haben, was spannend ist. Derzeit sehen wir, dass die Modelle immer besser werden, und die nächste Generation von Modellen steht kurz vor der Veröffentlichung, obwohl sie nicht auf dem Connect angekündigt wird. Darüber hinaus haben wir den persönlichen Assistenten Muse, der bisher sehr gut aufgenommen wurde.

Wenn man diese Dinge baut, ist man sich tatsächlich nicht sicher, wie es ausgehen wird. Uns selbst gefällt es. Anfang dieses Jahres habe ich zu Hause auf meine eigene Art Open Claw zusammengestellt, um zu spüren, wie dieses Ding funktioniert und wie man daraus ein magisches Erlebnis machen kann, das jeder nutzen kann.

Im Grunde, als wir – ich, Nat und Alex – zusammensaßen und erkannten, dass dies ein magisches Erlebnis war, und dass, wenn wir es in eine Out-of-the-Box-Version verwandeln könnten, die auch normale Menschen nutzen können, die nichts von Technologie verstehen, keinen Mac Mini selbst installieren wollen, nicht im Terminal herumwerkeln wollen und nicht debuggen wollen, wenn etwas schiefgeht, hatte ich das Gefühl, dass dies etwas sein würde, das Milliarden von Menschen nutzen wollen.

Seitdem haben wir auf dieses Ziel hingearbeitet: Modelle speziell dafür abzustimmen, nicht nur den Assistenten selbst und das Laufzeit-Framework zu bauen, sondern auch die Technologie, die jedem Assistenten eine unabhängige Computing-Umgebung bietet – dafür haben wir die gesamte sichere virtuelle Maschine Muse gebaut.

Intern dachten wir immer, dass dies etwas Besonderes sei, und das interne Team liebte es, aber man weiß nie, wie die Leute nach einer Produkteinführung reagieren werden. Gelegentlich gibt es Fälle, in denen es gleich beim ersten Mal ein Volltreffer ist, aber meistens bekommt man etwas positives Feedback und muss ein paar Dinge iterieren, bevor das Produkt wirklich „klickt“. Und dieses Mal hat es sofort „geklickt“. Es ist wirklich aufregend, das zu sehen – in nur zwei Wochen nutzen es bereits Millionen von Menschen, was ziemlich selten ist. Wir erleben diese Art von Situation nur alle paar Jahre, aber es ist definitiv einer der angenehmsten Momente für ein Startup.

Moderator: Ich bewundere wirklich Ihre Fähigkeit, im Spiel zu bleiben und es weiter zu versuchen. Und so oft einen Home Run zu schlagen, ist wirklich beeindruckend. In einem früheren Interview mit Joe Rogan vor etwa drei Jahren haben Sie am Ende erwähnt, dass man eines Tages einfach eine Brille aufsetzen könnte und ein KI-Assistent erscheinen würde. Ich habe also das Gefühl, dass Muse bereits eine physische Form hat, was sehr klug ist, weil es unvermeidlich erscheint.

Mark: Ich denke, es lässt es auch einfach freundlicher und niedlicher erscheinen. Ich denke, zu viele Menschen beschreiben KI als etwas Erschreckendes, aber KI sollte einfach nützlich und unterhaltsam sein. Diese physische Form – früh im Projekt hat ein Designer diese Figur erstellt, und aus irgendeinem Grund wollten sie immer wieder iterieren, aber die erste Version war die beste. Später sagte jemand: „Oh, sie muss blau sein, weil es Meta ist.“ Ich sagte: „Nein, ich denke, diese Form ist richtig, du hast es beim ersten Mal perfekt getroffen.“ Und das war's, es ist einfach unterhaltsam.

Wie unterscheidet sich persönliche KI von allgemeiner KI?

Moderator: Großartiges Detail. Wenn Sie möchten, dass das Modell bei persönlichen Angelegenheiten hervorragend ist, nicht nur als allgemeines Intelligenzmodell, wie würde sich der Trainingsansatz unterscheiden?

Mark: Ich denke, der Kern besteht derzeit darin, das Modell zu einem exzellenten „Agenten“ zu machen. Im vergangenen Jahr war der größte Trend Coding-Agenten, die zwei Kernideen enthalten: Programmier-Expertise und die allgemeine Fähigkeit, ein großartiger Agent zu sein.

Unsere Strategie ist es, priorisiert den Agenten selbst großartig zu machen, anstatt sich auf die Programmierfähigkeit zu spezialisieren.

Programmierfähigkeit ist wichtig, weil Muse selbst dann, wenn Benutzer nicht glauben, dass sie Code schreiben, immer im Hintergrund Code schreibt, um verschiedene Aufgaben zu erledigen. Aber wir glauben, dass der Agent in erster Linie ein exzellenter Agent sein sollte, und die Programmierfähigkeit dient diesem Ziel.

Darüber hinaus sind beim Aufbau eines persönlichen Assistenten einige Dinge wichtiger als beim Aufbau von Unternehmenssoftwareprodukten. Wenn Sie beispielsweise ein Unternehmens-Coding-Tool erstellen, muss das Modell kein Konzept von „Informationsoffenlegungsgrenzen“ haben – wie welche Informationen gesagt werden sollten und welche nicht. Aber für Muse ist dies sehr wichtig.

Sie müssen diese Fähigkeit in das Modell trainieren, genau wie jede andere Fähigkeit. Sie erzählen ihm viele Dinge, und dann möchten Sie, dass es Ihnen hilft, Ihre Ziele zu erreichen. Zum Beispiel möchten Sie, dass es Ihnen hilft, ein Restaurant zu buchen, Sie suchen ein geeignetes Restaurant, aber Sie haben vielleicht eine Allergie oder sind schwanger, und Sie möchten diese Informationen möglicherweise nicht dem Restaurant preisgeben. Aber Muse wird diese Informationen kennen, und Sie möchten, dass es die Aufgabe erledigt und dabei so wenig Informationen wie möglich preisgibt. Dies ist eine spezifische Fähigkeit, im Wesentlichen grundlegender menschlicher sozialer gesunder Menschenverstand.

Aber die meisten Unternehmen, die nur Coding-Agenten anbieten, haben diese Fähigkeit nicht in ihre Modelle trainiert. Wir können dies tun, weil wir Full-Stack arbeiten – wir nehmen nicht ein vorhandenes Modell von jemand anderem und setzen ein Framework darauf; wir trainieren das gesamte Modell von Grund auf, speziell für diese Fähigkeiten.

Das Modell braucht sicherlich eine breite allgemeine Intelligenz, aber es hat auch diese spezifischen Fähigkeiten. Darauf aufbauend baut man dann den gesamten Assistenten und all die Details drumherum auf: das Gedächtnis, das Laufzeit-Framework und die Art und Weise, wie er „Herzschläge“ sendet – er wacht regelmäßig auf und prüft: „Okay, das sind die Ziele, die ich über dich kenne, gibt es etwas, das ich jetzt voranbringen kann?“

Wir haben außerdem ein eigenes Team, das sich ausschließlich darauf konzentriert, die Echtzeit-Animationseffekte des Avatars zu perfektionieren, denn es ist nicht nur der Standard-Avatar – man kann jeden Avatar individuell anpassen, und dann bewegt er sich natürlich, und der Effekt ist fantastisch. Wir starten auch den Sprachmodus, in dem man Echtzeit-Sprachgespräche führen kann und der Assistent direkt an seiner Seite ist. Diese Details, denke ich, stammen alle daher, dass wir Full-Stack arbeiten – das Modell und das Produkt werden gemeinsam entwickelt.

Moderator: Eine weitere große Sache ist die virtuelle Maschine. Können Sie erklären, warum sie wichtig ist und was sie ermöglicht?

Warum gibt Meta jedem KI-Assistenten einen eigenen Computer?

Mark: Im Grunde braucht ein Agent, um Dinge für dich zu erledigen, einen Ort, an dem er deine Informationen speichern kann. Wir glauben, dass diese Informationen nicht mit den Informationen aller anderen in einem gemeinsamen Ressourcenpool vermischt werden sollten.

Stell es dir so vor: Dein Assistent wird viele sensible Informationen über dich kennen. Viele Menschen begegnen Agenten wie OpenCloud zunächst, indem sie zu Hause einen Mac Mini aufstellen. Also dachten wir, viele Leute wollen keinen Mac Mini kaufen oder ihn selbst einrichten. Welche Art von Erfahrung käme diesem Effekt am nächsten? Die Antwort ist: Du lädst einfach eine App herunter, meldest dich an und bekommst einen Computer, der nur dir gehört, damit dein Assistent arbeiten und Daten speichern kann, und baust darum ein Sicherheitsmodell auf. Das kommt dem nahe, einen eigenen Computer unter dem Schreibtisch zu haben – selbst wir bei Meta können nicht darauf zugreifen.

Zum Beispiel vertrauliche virtuelle Maschinen von Muse – das ist eine Funktion, die wir entwickeln, und selbst wir können nicht sehen, was sich im Inneren deiner virtuellen Maschine befindet.

Wir haben auch vieles drumherum gebaut, wie etwa sichere Speicherung von Anmeldedaten – wenn dein Assistent mit Informationen wie Passwörtern umgehen muss, muss er selbst diese Passwörter nicht sehen können; er muss nur in der Lage sein, die Anmeldedaten „einzufügen“, wenn du ihn bittest, sich bei einem bestimmten Dienst anzumelden, und das nur, wenn du es ausdrücklich verlangst. Das System sollte so gestaltet sein: Diese Informationen selbst sollten nicht frei zugänglich sein, denn Unfälle passieren immer, jemand könnte versuchen einzudringen, oder das System könnte Probleme haben.

Du musst also sicherstellen, dass der Agent nicht auf diese Daten zugreifen kann und Meta auch nicht. Jedem Assistenten einen unabhängigen Computer zur Verfügung zu stellen und die Sicherheit so extrem wie möglich zu gestalten, ist die grundlegende Basis dieser Technologie – sie gibt Muse sowohl die Fähigkeiten, die nötig sind, um Nutzern zu helfen, ihre Ziele zu erreichen, als auch gewährleistet sie Privatsphäre und Sicherheit und macht sie zu einem weltklasse, branchenführenden Produkt in diesem Bereich.

Moderator: Bedeutet das also, dass, genau wie bei WhatsApp, die Daten auf der virtuellen Maschine, mit der Muse verbunden ist, verschlüsselt sind? Wie sollten die Leute verstehen, wie Daten tatsächlich in der virtuellen Maschine gespeichert werden?

Mark: Wir haben im Grunde zwei Versionen entwickelt. Die Muse Secure VM enthält verschiedene Datenschutzfunktionen, einschließlich der gesamten von uns entwickelten Sentinel-Agent-Architektur. Du hast einen gewöhnlichen Muse-Assistenten, der Aufgaben für dich ausführt, und gleichzeitig gibt es auch einen Sicherheitsagenten, den wir Sentinel nennen, der speziell den Datenfluss in und aus deiner Muse überwacht.

Wenn externe Inhalte versuchen, die Sicherheit zu durchbrechen, wird Sentinel sie direkt abschneiden und daran hindern. Wenn er der Meinung ist, dass deine Muse kurz davor steht, eine Aktion durchzuführen, die dein Eingreifen erfordert, wird er den Betrieb von Muse übersteuern und einen Alarm auslösen, damit eine Person die Berechtigung bestätigt – zum Beispiel: „Möchtest du, dass Muse dies tun kann?“

Dieses gesamte System, plus sichere Speicherung von Anmeldedaten, plus mehrere Schichten der Verteidigung in der Tiefe, bilden zusammen die Muse Secure VM.

Wir entwickeln auch ein weiteres Projekt. Nat und ich haben speziell Moxie Marlinspike rekrutiert – genau die Person, die damals mit uns zusammengearbeitet hat, um die Ende-zu-Ende-Verschlüsselung von WhatsApp umzusetzen –, um die Muse Confidential VM zu entwerfen. Die Kernidee ist, dass du zusätzlich zur sicheren virtuellen Maschine auch einen dedizierten Verschlüsselungsschlüssel erhältst, sodass selbst Meta nicht auf die Inhalte im Inneren zugreifen kann.

Diese Version ist schwieriger umzusetzen, denn wenn Meta nicht auf das Innere der virtuellen Maschine zugreifen kann, wird das Debugging und die Sicherstellung, dass das System ordnungsgemäß läuft, viel schwieriger. Deshalb haben wir einige Zeit damit verbracht, aber sie wird bald auf den Markt kommen. Damit wird im Grunde der Sicherheitsstandard erreicht, den die Menschen bereits von WhatsApp und unseren anderen sichersten Produkten kennen.

Host: Ist der Vorteil davon nur, dass sich die Menschen psychologisch sicherer fühlen, oder gibt es tatsächliche Vorteile?

Mark: Ich denke, Sicherheit selbst ist wichtig. Unser Ziel ist es, dir annähernd eine lokale Maschine unter deinem Schreibtisch zu geben. Was gibt dir diese lokale Maschine? Sie bedeutet, dass kein Unternehmen darauf zugreifen kann.

Angenommen, Meta möchte dir diesen Dienst anbieten, wie können wir dir dann die gleiche Privatsphäre und Sicherheitsgarantien bieten, sodass kein Unternehmen – ob Meta oder jemand, der versucht, in uns einzudringen, oder in einigen Ländern, in denen du der lokalen Regierung nicht vertraust – darauf zugreifen kann? Denn wir selbst kommen auch nicht hinein, weil wir keinen Zugang haben.

Ich denke, das ist sehr wichtig, und es ist auch ein wichtiger Grund, warum die Menschen WhatsApp vertrauen. Das ist echter Wert für Privatsphäre, Sicherheit und Vertrauen.

Wenn du einen Assistenten haben wirst, der alles über dich weiß – ich schätze, fast alle von uns werden einen solchen Assistenten haben –, dann spulen wir 5 Jahre vor: Jeder wird einen Assistenten haben, der deine Ziele und alles zutiefst versteht und dir helfen kann, Dinge zu erledigen. In dieser Situation ist es sehr wichtig, in Bezug auf Privatsphäre und Sicherheit branchenführend zu sein. Das wollten wir von Anfang an tun.

Wie formt man die Persönlichkeit von KI?

Host: Es gibt noch etwas, das sehr interessant ist – du hast an der Universität Psychologie studiert.

Mark: Nun, ich war nur für sehr kurze Zeit dort, zwei Jahre, aber ich habe das Gefühl, dass es viele Dinge beeinflusst hat, die ich später aufgebaut habe.

Host: Wenn wir uns Modelle ansehen, sagen wir oft, dass ein bestimmtes Modell "sehr intelligent" ist. Aber so wie wir Freunde auswählen, ist es sicherlich, weil sie intelligent sind, und auch, weil wir ihre Energie und die Art, wie wir miteinander auskommen, mögen. Wie denken Sie über die Gestaltung der Persönlichkeit eines Modells?

Mark: Ich denke, das ideale Modell sollte anpassungsfähig genug sein, um zu den Stilen verschiedener Menschen zu passen. Ich denke, viele in der Branche haben das falsch verstanden – viele andere Labore konzentrieren sich darauf, "wie man die Persönlichkeit richtig gestaltet", aber ich habe nie gedacht, dass Persönlichkeit eine feste Sache ist. Dies ist einer der Gründe, warum ich so stark an Open Source glaube, so stark daran glaube, dass Menschen anpassen können, und es ist auch der Grund, warum wir Muse als ein hochgradig persönliches Produkt entwickelt haben.

Sie können Muse anpassen und personalisieren – nicht nur das Aussehen und die Stimme. Wenn Sie sich zum ersten Mal anmelden, fragt es Sie zuerst: "Wie soll meine grundlegende Persönlichkeit sein", und Sie können es jederzeit ändern.

Wir bemühen uns, das Modell hochgradig steuerbar zu machen, damit Sie die Art der Interaktion definieren können, die Sie wünschen. Dies ist ein wichtiger Teil, um es zu einem hervorragenden persönlichen Assistenten zu machen – diese Anpassungsfähigkeit in Bezug auf die Persönlichkeit ist entscheidend.

Host: Welchen Stil hat Ihre eigene Muse?

Mark: Ich habe sie direkt und effizienzorientiert gemacht. Es ist ziemlich interessant. Frühere Versionen waren sehr sarkastisch und humorvoll, aber die aktuelle Version ist geradliniger. Mein Assistent verwendet das Standard-Muse-Aussehen, aber ich habe ihn in eine Toga gekleidet und ihm eine tiefe, etwas komische Stimme gegeben. Die Interaktion mit ihm macht Spaß.

Host: Ich denke, um Sinn für Humor zu haben, muss man wirklich intelligent sein. Viele Menschen erkennen nicht, dass Komiker einige der intelligentesten Menschen in der Gesellschaft sind – schnelle Reaktionen, genügend Witz. Sie haben definitiv diese Eigenschaft. Wenn ich mir all Ihre Interviews ansehe, haben Sie immer gut abgeschnitten.

Marks unerwartete Vorhersagen über KI und das Metaverse

Host: In Ihrem Interview mit Theo haben Sie viel über die nächste Grenze der Technologie und darüber gesprochen, wohin all dies letztendlich führt. Der KI-Bereich hat mehrere "Winter" durchgemacht, in denen die Menschen dachten, es gäbe keine Durchbrüche. Das Metaverse hat auch mehrere solcher Perioden durchgemacht, in denen alle dachten, es sei eine nicht lieferbare Wette. Ich habe gestern die neue holografische Avatar-Funktion ausprobiert, sie ist sehr cool. Im Interview mit Lex fühlte es sich an, als würde es 11 Stunden dauern, Ihr Gesicht aufzunehmen, jetzt dauert es nur 3 Minuten. Wie hat sich dies bis zum heutigen Stand entwickelt?

Mark: In der Gesamtentwicklung des Metaverse, als wir Reality Labs gründeten, glaubten wir immer, dass es irgendwann normale aussehende gewöhnliche Brillen geben würde, und mit der Zeit könnten sie sowohl immersive Präsenz bieten als auch hervorragende KI-Geräte werden – weil Brillen die einzige Form sind, die es einem Gerät ermöglicht, zu sehen, was Sie sehen, zu hören, was Sie hören, den ganzen Tag über Ihr Ohr mit Ihnen zu kommunizieren und schließlich Bilder anzuzeigen.

Aber vor 10 bis 15 Jahren ging ich davon aus, dass wir zuerst die Holografietechnologie erreichen würden und dann eine hochentwickelte KI. Der Weg der technologischen Evolution ist jedoch interessant – wir haben tatsächlich zuerst KI und persönliche Superintelligenz bekommen und dann die Technologie, um Holografie weit verbreitet und erschwinglich genug zu machen. Das habe ich nicht vorhergesehen, aber ich bin froh, dass wir in beide Richtungen arbeiten.

Unsere erheblichen Investitionen in Brillen haben uns in eine sehr vorteilhafte Position gebracht, wenn KI-Assistenten bereit sind. Viele der Ankündigungen auf dem Connect drehten sich genau darum, Muse und viele KI-Funktionen in Brillen zu bringen, und ich denke, die Nutzer werden es wirklich mögen. Das ist eine große Sache.

Was Präsenz betrifft, kommen wir immer noch voran, aber der Fortschritt ist relativ langsamer, weil sich der Großteil unserer Energie auf den Aufbau von Muse und KI-Funktionen für Brillen verlagert hat. Wir haben jedoch ein langjähriges Projekt zu Echtzeit-High-Fidelity-Avataren.

Wie Sie sagten, brauchte man vor drei oder vier Jahren einen ganzen Scanraum, um eine Person aus allen Winkeln aufzunehmen, und dann brauchte man GPUs der Enterprise-Klasse zum Rendern, was sehr umständlich war. Die Demo, die wir für den Lex-Podcast gemacht haben, war eine solche Einrichtung. Jetzt haben wir es im Grunde geschafft, sie in einer VR-Brille laufen zu lassen – dies ist die erste Brillenform, die ein so erstaunliches VR-Erlebnis ermöglicht, statt eines großen Headsets. Nur ein paar Fotos können Ihren Avatar erstellen, und der Fortschritt ist erstaunlich.

Gastgeber: Und es kann auch Ausdrücke basierend auf der Stimme steuern. In der Demo brachte es mich zum Lachen, ließ mich interagieren und verstand dann, wie sich mein Gesicht mit der Audiospur bewegt. Sie erwähnten in diesem Podcast, dass einige Leute, die normalerweise in ihren Ausdrücken zurückhaltender sind, tatsächlich reichere Ausdrücke in der virtuellen Welt wollen. Wie sehen Sie die Unterscheidung der Menschen zwischen ihrem „virtuellen Selbst“ und „realen Selbst“?

Mark: Ich denke, wir stehen noch sehr am Anfang, was das Verständnis der Soziologie und Psychologie davon angeht. Ich denke, die Wahrnehmung, die Menschen von sich selbst haben, und das Bild, das sie projizieren wollen, unterscheiden sich oft etwas von dem, wer sie tatsächlich sind. Seit der Geburt sozialer Netzwerke haben Menschen sorgfältig Avatare ausgewählt. Bei Muses Avataren haben wir ein ähnliches Phänomen gesehen. Es geht nicht so sehr darum, sich selbst zu „kuratieren“, sondern die „Person“ zu „kuratieren“, mit der man kommunizieren möchte.

Ich denke, wenn man Menschen die Fähigkeit gibt, sich auszudrücken, möchte man, dass es sie wirklich einfängt, und gleichzeitig ist es selbst eine Form des Ausdrucks, nicht nur eine reine Spiegelreflexion – es ist sowohl Kommunikation als auch Ausdruck. Wir hoffen, etwas zu bauen, das beides ausbalanciert. Das ist immer eine iterative Schleife: Sehen, wie Menschen es nutzen, dann verbessern. Nach jahrelanger Arbeit stehen wir jetzt wirklich an der Startlinie – zum ersten Mal können wir wirklich ziemlich hochwertige realistische Avatare in Produkte bringen, nutzbar auf Telefonen und in VR. Ich bin sehr gespannt auf die Ergebnisse.

Wie wird 2030 aussehen?

Gastgeber: Okay, nehmen Sie mich mit in Ihr Denken, spulen Sie vor bis 2030, wenn alles gut geht, wie wird die Holografietechnologie-Seite aussehen? Hologramme plus Muse, plus Brillen, wie kommt das alles zusammen?

Mark: Mein Verständnis der Metaverse-Vision drehte sich schon immer darum, die physische Welt effektiv mit der digitalen Welt zu verschmelzen. Die Grundidee ist: Wir haben diese wunderbare physische Welt, und gleichzeitig haben wir auch eine wunderbare digitale Welt – die riesige Menge an Inhalten, die sich über 20 bis 30 Jahre im Internet angesammelt hat, die atemberaubend ist. Aber die Art und Weise, wie wir darauf zugreifen, ist entweder, indem wir an einem Schreibtisch sitzen oder über einen kleinen Bildschirm in unserer Tasche, was grundlegend sehr begrenzt ist.

Ich denke, die idealste Version davon ist eine nahtlose Verschmelzung der physischen und der digitalen Welt. Stellen Sie es sich so vor: Im Moment sind wir beide hier. In einer zukünftigen Version könnte einer von uns eine holografische Projektion sein, aber Sie spüren immer noch dieses Gefühl, dass der andere wirklich anwesend ist, was sich völlig von einem Videoanruf unterscheidet.

Und der Kern der virtuellen Realität besteht genau darin, dieses Gefühl der Präsenz zu vermitteln – Sie wirklich spüren zu lassen, dass Sie sich im selben Raum mit anderen befinden oder an einem anderen Ort. Sie können dies mit holografischer Technologie erreichen und es auf verschiedene Weise mischen. Zum Beispiel kann ich eine Runde Poker mit Freunden spielen, von denen einige anwesend sind und andere über holografische Avatare teilnehmen, und sie können auch Karten spielen, und der Kartentisch selbst kann ebenfalls holografisch sein, sodass diejenigen, die nicht anwesend sind, ebenfalls integriert werden können.

Gleichzeitig kann KI auch eine physische Form erhalten und in dieser Szene erscheinen. In Arbeitsszenarien macht dies sehr viel Sinn – ich verwende bereits ständig verschiedene Coding-Agenten, um Dinge zu bauen. Stellen Sie sich Folgendes vor: Sie haben einen Gruppenchat-Kanal mit mehreren Personen und mehreren Agenten, und Sie weisen den Agenten Aufgaben zu. Aber manchmal versammeln sich alle zu einem Meeting, und die Agenten sollten vielleicht auch anwesend sein. Wie erscheinen sie? Einfach, fügen Sie einfach ein paar weitere Sitze auf dem Sofa hinzu, und sie erscheinen als holografische Avatare. Oder verwenden Sie diese niedliche kleine Muse-Figur oder einen Drachen oder irgendein seltsames und verrücktes Bild, das Sie erstellen.

Ich schätze, das wird sich in Zukunft ganz natürlich anfühlen.

Moderator: Interessant. In Ihren früheren Interviews haben Sie gesagt, dass die Tech-Branche oft den „Spaß“ vergisst. Ich denke, einen physischen Assistenten dort erscheinen zu lassen, würde es auch realer wirken lassen – als ob Arbeit wirklich ausgelagert wird. Wenn Sie sehen, wie Muse tippt, haben Sie das Gefühl, dass wirklich etwas passiert. Das ist sehr gut gemacht – man kann sehen, was im Browser passiert. Also, denken Sie, dass ein solches Szenario möglich ist: Sie tragen die Brille und steuern dann Ihren Computer, lassen Muse Dinge für Sie am Computer erledigen?

Mark: Oh, definitiv. VR kann das bereits. Sie können einfach einen Platz zum Sitzen finden, ein Café ist in Ordnung, und dann Ihren Arbeitsplatz öffnen, mit sechs Monitoren, darauf Code schreiben, alles ist da.

Auf der Brillenseite hat das derzeit beliebteste Modell kein Display, was einerseits es erschwinglicher macht und mehr Menschen die Nutzung ermöglicht, und andererseits arbeiten wir noch daran, ein Display in die kompakteste Form zu integrieren. Aber wir haben bereits eine Display-Version der Meta Ray-Ban herausgebracht, die sehr beliebt ist, und es ist ein kleines Display. Wir haben auch eine Prototyp-Version von holografischem AR mit vollem Sichtfeld herausgebracht, was meiner Meinung nach sehr spannend sein wird.

Die gesamte Produktlinie ist also so: von reinen Audio-Brillen – keine Kamera, sehen aus wie gewöhnliche Brillen, aber mit Muse darin, sodass Sie verschiedene Audio-Tools nutzen, Musik hören, Anrufe tätigen können – bis hin zu höherwertigen Versionen, alle existieren.

Moderator: Ich frage mich, können Sie mit diesen Audio-Brillen mit Muse sprechen, während Ihr Heimcomputer Dinge erledigt?

Mark: Ja, absolut. Wir haben diese Funktion gerade auf der Connect-Konferenz veröffentlicht.Jetzt sind alle Brillen mit Meta AI verbunden, was ein „Single-Turn“-Erlebnis ist – du sendest eine Eingabeaufforderung, es antwortet, und das war's. Aber mit Muse werden wir im Grunde alle Brillen auf Muse aufrüsten. Erstens musst du nicht mehr „Hey Meta“ sagen, du kannst ihm einen beliebigen Namen geben, was Teil des Spaßes ist. Dann sprichst du einfach direkt mit ihm, und es verbindet sich mit deinem Muse, und dein Muse erledigt Aufgaben in deiner sicheren virtuellen Maschine und hilft dir, Dinge zu erledigen.

Host: Das ist erstaunlich!

Gründer-Mindset

Host: Okay, wir sind jetzt hier, Muse macht gute Fortschritte, und die Brillen laufen auch gut, aber vor etwa einem Jahr fragten viele Leute: „Was genau ist mit dem Superintelligenz-Labor passiert?“ In diesem Moment, wie hast du dich innerlich gefühlt? Wenn die Dinge nicht gut laufen, aber du immer noch die langfristige Vision siehst, was für eine Erfahrung ist das?

Mark: Was wirklich schiefgelaufen ist, war das Llama-Projekt und Llama 4.

Llama 1 war ein ziemlich interessantes Modell, es hat die ganze Open-Source-KI-Bewegung gestartet, und wir sind sehr stolz darauf. Llama 2 erreichte Skalierung, Llama 3 war ein gutes Modell, fast an der Spitze der damaligen Zeit. Dann kam Llama 4, und wir sind im Grunde von der Bahn abgewichen, auf der wir hätten sein sollen.

Wann immer die Dinge nicht so laufen, wie ich es erwarte, verbringe ich viel Zeit damit, nachzudenken: Warum ist das passiert? Was müssen wir ändern, um es besser zu machen? Diesmal war meine Reflexion: Ich habe die gesamte Teamstruktur falsch aufgestellt.

Ich habe es so modelliert, wie wir Machine-Learning-Arbeiten wie Instagram-Feed- oder Anzeigensysteme machen – mit Hunderten oder sogar Tausenden von Menschen, die parallel an vielen Dingen arbeiten. Aber für den Aufbau von Sprachmodellen braucht man wirklich ein extrem enges kleines Team, das es als ein Gruppenwissenschaftsprojekt behandelt. Man braucht nicht viele Leute, aber das bedeutet, dass jeder Platz im Team extrem kostbar ist.

Also haben wir die besten Leute aus dem gesamten Meta-Unternehmen zusammengebracht und gleichzeitig viele brillante Menschen aus der gesamten Branche eingebracht, um ein brandneues Team zu bilden – Meta Superintelligence Labs.

Aus meiner Sicht, als MSL startete, wusste ich, dass es einige Zeit dauern würde, neu zu starten, die Infrastruktur wieder aufzubauen und die nächste Generation von Modellen zu trainieren. Aber ich wusste, dass wir ein ausgezeichnetes Team zusammengestellt hatten, und wenn das Team zusammenwachsen und gut funktionieren könnte, wären die Ergebnisse gut.

Für mich war der aufregendste Moment, eigentlich nach der Veröffentlichung von Llama 4 – ich dachte, wir wären auf Kurs, aber es stellte sich heraus, dass wir es nicht waren. Das war eine ziemlich große negative Überraschung. Ich denke, als Unternehmer wird man in solchen Momenten immer auf die Probe gestellt, denn unweigerlich wird nicht alles reibungslos verlaufen. Und was die Flugbahn wirklich bestimmt, ist: Wenn die Dinge nicht so laufen, wie du es erhoffst, wie findest du einen Weg nach vorne.

Host: Ich schätze, das Gegenteil ist auch wahr – wenn etwas deine Erwartungen weit übertrifft, wie die Einführung von Muse, wie stellst du sicher, dass du diese Gelegenheit ergreifen kannst?

Mark: Genau. Jetzt ist das ganze Unternehmen voll dabei – anfangs war es nur ein kleines Team, das ein Produkt entwickelte, aber jetzt erkennen alle, dass es wirklich bereit für die große Bühne ist. Das ganze Unternehmen denkt darüber nach, wie man dieses Ding groß machen kann, wie man Hunderte Millionen Menschen davon begeistern kann.

Von der Optimierung der gesamten Infrastruktur, damit alles reibungslos läuft und jede einzelne Rechenleistung aus den vorhandenen GPUs herausgeholt wird, bis hin zu verschiedenen Produktteams, die Muse auf unterschiedliche Weise einbinden – wie Brillen. Zu sehen, wie alle zusammenarbeiten, um sicherzustellen, dass Muse reibungslos skalieren kann, dieses Gefühl ist großartig.

Wie Mark Vision schreibt und kommuniziert

Host: Als Gründer habe ich das Gefühl, dass das der Moment ist, nach dem man sich am meisten sehnt – wenn alles zusammenkommt. Wie kommunizierst du die Vision an das Unternehmen? Da so viele Dinge gleichzeitig vorangetrieben werden, habe ich das Gefühl, dass du viel schreibst. Wie läuft dein Prozess ab?

Mark: Schreiben hilft mir sehr, sowohl beim Verfeinern meiner eigenen Gedanken als auch bei der Kommunikation nach außen. Diesen Sommer habe ich einen sehr langen Text mit dem Titel „Die Zukunft gehört allen“ geschrieben, etwa 15 Seiten, der mir systematisch geholfen hat