Autor: Long Yue, Wallstreetcn
Trzy lata temu dyrektor generalny Meta, Zuckerberg, powiedział w programie Joe Rogana, że pewnego dnia, gdy ludzie założą okulary, pojawi się z nimi Agent AI. Teraz ta scena może się urzeczywistniać.
Osobisty Agent AI Meta, Muse, osiągnął miliony użytkowników w ciągu dwóch tygodni od premiery. Zuckerberg powiedział w programie wywiadowczym 25 września: „Co kilka lat dostajemy coś takiego”. Ocenił wczesne przyjęcie Muse jako „home run od razu na starcie”—co jest rzadkością w historii produktów Meta.
Jednocześnie ogłosił, że Muse zostanie zintegrowany z całą linią inteligentnych okularów Ray-Ban, a użytkownicy nie będą już musieli mówić „Hey Meta”, ale będą mogli dostosować słowo wybudzające, aby bezpośrednio wywołać swojego osobistego Agenta AI.
Przez lata metaverse, inteligentne okulary i duże modele, które świat zewnętrzny postrzegał jako trzy niezależne zakłady, przyspieszają swoją konwergencję na poziomie produktów wewnątrz Meta.
W tym wywiadzie Zuckerberg przyznał również, że porażka Llama 4 była „najstraszniejszym momentem” i ujawnił, że Meta buduje klaster treningowy o mocy 5 gigawatów, wierząc, że wystarczająco duża moc obliczeniowa może „brute-force” AGI.
Dlaczego Muse może być „home run od razu na starcie”
Punktem wyjścia Muse było to, że Zuckerberg usiadł z członkami zespołu Natem i Alexem, używając narzędzi open source, aby „poskładać” wczesną wersję w domu.
„Zdaliśmy sobie sprawę, że to magiczne doświadczenie”, powiedział Zuckerberg, „gdybyśmy mogli uczynić to czymś, czego każdy może używać—bez konieczności kupowania własnego Mac Mini, bez konieczności majstrowania w terminalu—to byłoby coś, czego miliardy ludzi chciałyby używać”.
Ten osąd napędzał całą późniejszą logikę B&R: nie tylko trenowanie modeli, ale pełny stos samodzielnego rozwoju od modelu, rusztowania, po mechanizm „bicia serca” Agenta—Agent będzie automatycznie budził się okresowo, sprawdzał cele użytkownika i proaktywnie realizował zadania do wykonania.
Dane po premierze potwierdziły ten osąd. Dwa tygodnie, miliony użytkowników.
Personal AI: nacisk na wykonanie, pamięć i „osąd”
Odnośnie różnicy między personal AI a ogólnym AI, Zuckerberg podsumował obecny cel konkurencji jako uczynienie modeli lepszymi Agentami.
„Największą rzeczą w minionym roku jest w zasadzie kodowanie Agentów”. Powiedział, że umiejętność kodowania jest ważna, ponieważ nawet jeśli użytkownicy nie piszą bezpośrednio kodu, „twoja Muza również będzie cały czas pisać kod za ciebie w tle, aby osiągnąć różne rzeczy”.
Uważa jednak, że osobisty Agent nie może mieć jedynie zdolności kodowania lub wykonywania zadań; musi również rozumieć granice prywatności i kontekst społeczny.
Zuckerberg podał przykład: gdy użytkownik prosi Muzę o zarezerwowanie restauracji, Agent może znać informacje takie jak alergie użytkownika lub ciąża, ale to nie oznacza, że te informacje powinny być automatycznie ujawniane. „Chcesz, aby wykonał zadanie, ujawniając jak najmniej informacji”.
Powiedział, że ta zdolność należy do „podstawowych umiejętności społecznych lub zdrowego rozsądku”, które ludzie zwykle posiadają, ale jeśli firmy trenują tylko Agentów kodujących, wiele z nich nie włączyło tego do zakresu możliwości modelu.
„Trenujemy cały model, zamiast brać gotowy model kogoś innego i budować wokół niego framework i Agenta” – powiedział Zuckerberg.Meta dodała również funkcje na poziomie produktu, takie jak pamięć, śledzenie zadań, animacja wirtualnych postaci i interakcja głosowa w czasie rzeczywistym.
Odnośnie personalizacji, powiedział, że Meta nie wierzy, że AI powinno mieć tylko jedną stałą osobowość. „Wiele laboratoriów koncentruje się na tym, jak dostroić osobowość do właściwego stanu, ale nigdy nie wierzyłem, że istnieje tylko jedna poprawna odpowiedź dla osobowości”.
Powiedział, że Muza pozwala użytkownikom modyfikować awatar, głos i podstawową osobowość, a model jest zaprojektowany tak, aby był wysoce kontrolowalny. „Możesz zdefiniować, jak chcesz z nim wchodzić w interakcje, co jest bardzo ważne dla osobistego Agenta”.
Każdy Agent ma swój własny „komputer”
Jedną z podstawowych różnic infrastrukturalnych między Muzą a innymi produktami AI jest to, że Meta wyposaża każdego Agenta we własną Bezpieczną Maszynę Wirtualną.
Zuckerberg wyjaśnił, dlaczego jest to konieczne:
Twój Agent będzie wiedział o Tobie wiele wrażliwych informacji. Nie uważamy, że te informacje powinny być mieszane w jednej puli z danymi wszystkich innych.
Porównał Muse Secure VM do „tego komputera pod Twoim biurkiem, który należy tylko do Ciebie” — dane użytkownika są przechowywane w formie zaszyfrowanej, a wrażliwe poświadczenia, takie jak hasła, są zarządzane przez niezależny moduł bezpieczeństwa, którego sam Agent nie może bezpośrednio odczytać.
Na tej podstawie Meta zaprojektowała również Agenta bezpieczeństwa „Sentinel” specjalnie do monitorowania przepływów danych do i z Muse. Gdy tylko zostaną wykryte anomalie lub operacje wysokiego ryzyka, bezpośrednio je przechwyci i poprosi użytkownika o autoryzację.
Metaverse, inteligentne okulary i Agenci: trzy ścieżki się zbiegają
W wywiadzie Zuckerberg ujawnił, że Muse zostanie w pełni zintegrowany z serią inteligentnych okularów Ray-Ban i ulepszy istniejącą metodę interakcji.
Obecne okulary oferują doświadczenie „jednoturowej rozmowy” — powiedz jedną rzecz, otrzymaj jedną odpowiedź i to koniec. Po zintegrowaniu Muse, okulary stają się punktem wejścia front-endu dla Agenta: użytkownik mówi, a back-endowy Muse kontynuuje pracę w Secure VM, a następnie zgłasza z powrotem po zakończeniu zadania.
Odnośnie planu rozwoju produktu okularów, opisał wyraźną drabinkę sprzętową:
- Okulary audio bez kamery: już wyposażone w Muse, mogą obsługiwać połączenia, muzykę i zadania głosowe
- Meta Ray-Ban z małym wyświetlaczem: już wydane, z podstawowym sprzężeniem zwrotnym wizualnym
- Prototyp holograficznego AR z pełnym polem widzenia: już wydany, który Zuckerberg nazwał „bardzo ekscytującym”
Powiedział, że długoterminowe inwestycje Meta w okulary stawiają firmę w stosunkowo korzystnej pozycji, gdy Agenci AI dojrzeją.Meta wprowadza Muse i więcej funkcji AI do swoich produktów okularowych, podczas gdy technologia metaverse, która wcześniej kładła nacisk na większe poczucie „obecności”, wciąż się rozwija, choć obecnie więcej zasobów przesuwa się w kierunku Muse i funkcji AI inteligentnych okularów.
Jeśli chodzi o wirtualne awatary, Zuckerberg powiedział, że Meta wcześniej potrzebowała urządzeń w skali pomieszczenia, skanowania pod wieloma kątami i środowisk GPU klasy enterprise, aby generować stosunkowo wysokiej jakości realistyczne awatary; teraz użytkownicy mogą完成 konfigurację za pomocą zaledwie kilku zdjęć, a powiązana funkcja może już działać w parze okularów VR.
Patrząc w przyszłość na 2030 rok, Zuckerberg powiedział, że główna wizja metaverse zawsze polegała na integracji świata fizycznego i cyfrowego. Na przykład, powiedział, w przyszłości ludzie będą mogli uczestniczyć w zajęciach offline razem z przyjaciółmi, którzy dołączą poprzez holograficzne obrazy; w scenariuszach pracy ludzie i wielu Agentów będzie mogło również wspólnie uczestniczyć w czatach grupowych lub spotkaniach, a Agenci mogą pojawiać się jako holograficzne postacie lub w innych ucieleśnionych formach.
"Najstraszniejszy moment": Potknięcie Llama 4
Nie wszystkie zakłady poszły gładko. W wywiadzie Zuckerberg rzadko mówił bezpośrednio o porażce Llama 4.
Po Llama 4 to był najstraszniejszy moment... Myślałem, że jesteśmy na dobrej drodze, ale nie byliśmy. To była dość duża negatywna niespodzianka.
Przypisał problem fundamentalnemu błędowi w strukturze zespołu:
Zbudowałem zespół w sposób charakterystyczny dla systemu rekomendacji Instagrama lub systemu reklam - setki lub tysiące osób parły naprzód równolegle. Ale trenowanie modelu językowego wymaga ściśle współpracującego małego zespołu, realizującego to jako grupowy projekt naukowy. Każde miejsce jest niezwykle cenne.
W rezultacie Meta całkowicie się zreorganizowała, szeroko sprowadzając najlepsze talenty z całej branży i ustanowiła Meta Super Intelligence Lab (MSL). Zuckerberg powiedział, że nowa generacja modeli zostanie wkrótce wydana, ale nie zostanie ogłoszona na konferencji Connect.
Ścieżka obliczeniowa: Brutalna siła w kierunku AGI, projekt o mocy 5 gigawatów w budowie
Mówiąc o technicznej ścieżce do AGI, Zuckerberg wydał bezpośredni osąd.
Nie jestem pewien, jaki fundamentalny przełom architektoniczny jest jeszcze potrzebny... Myślę, że już w przybliżeniu znamy przepis. Jeśli możesz zbudować wystarczająco duży klaster superkomputerów, możesz brute-force'ować swoją drogę do celu.
Obecna ścieżka ekspansji obliczeniowej Meta: klaster o mocy ponad 1 gigawata w Ohio jest zasadniczo już używany do trenowania następnej generacji modeli; klaster klasy 5 gigawatów w Luizjanie jest w budowie.
Powiedział, "Kiedy masz klastry o mocy wielu gigawatów do trenowania, zasadniczo otrzymasz coś bliskiego AGI, a nawet superinteligencji."
Jednak dodał również, że obecna ścieżka napędzana obliczeniami nie oznacza, że badania architektoniczne są nieistotne -
Ludzki mózg zużywa tylko około 10 watów, podczas gdy nasze systemy mogą być milion razy mniej wydajne niż on. Tylko łącząc obliczenia na dużą skalę i przełomy architektoniczne, możemy naprawdę przewodzić.
Dopasowanie nie jest ciężarem, lecz problemem, który produkt musi rozwiązać
Stosunek Zuckerberga do bezpieczeństwa AI jest bardzo pragmatyczny – nie traktuje go jako presji regulacyjnej, ale jako warunku wstępnego, czy produkt może odnieść sukces.
Jeśli poprosisz Muse o zrobienie jednej rzeczy, ale zrobi ona coś przeciwnego, kto by jej jeszcze używał? Musimy sprawić, by model nie tylko rozumiał twoje konkretne instrukcje, ale także rozumiał twoje intencje i twoje wartości.
„Aby Muse osiągnął miliard użytkowników, musimy rozwiązać problem dopasowania, albo przynajmniej poczynić na tym polu bardzo duże postępy”. powiedział.
Odnośnie granic bezpieczeństwa podczas procesu treningowego, użył analogii: „To jak rodzice ustalający zasady dla swoich dzieci – jeśli „ukończy” problem programistyczny poprzez modyfikację konfiguracji systemu, chcę mu powiedzieć: Nie, poprosiłem cię, abyś nauczył się metody rozwiązywania problemu, a nie znalazł skrót, aby go obejść”.
Pełny wywiad wygląda następująco:
Podejmowanie dużych zakładów
Prowadzący: Miliardy ludzi będą chciały tego używać. Jak to jest dla ciebie budować coś takiego? Czy „nieśmiertelność” jest możliwością? Dobrze, jeśli zabierzesz mnie do swojego umysłu i przewiniesz do 2030 roku, jak to będzie wyglądać?
To jest Mark Zuckerberg. Dwadzieścia dwa lata temu zbudował sieć społecznościową, która połączyła miliardy ludzi i na zawsze zmieniła świat. A teraz zdecydował się zbudować coś jeszcze większego. W tym celu podejmuje duże zakłady w metaverse, inteligentnych okularach i sztucznej inteligencji. Przez lata sceptycy uważali, że to trzy oddzielne, niemożliwe zakłady, ale przegapili szerszy obraz – ponieważ teraz te zakłady zbiegają się, wspólnie tworząc zupełnie nowy rodzaj superinteligencji.
Dzisiaj przedstawimy to wszystko wszystkim, a ja zadam Markowi kilka pytań, których nigdy wcześniej nie zadano, wysłucham jego wizji przyszłości, abyście mogli planować z wyprzedzeniem i zbudować następną wielką rzecz.
Prowadzący: Dziękuję bardzo za przyjście do programu.
Mark: Dziękuję, cieszę się, że tu jestem.
Prowadzący: Na potrzeby tej rozmowy obejrzałem każdy wywiad, jakiego kiedykolwiek udzieliłeś.
Mark: Wow, to więcej niż ja sam obejrzałem.
Prowadzący: To była świetna zabawa i bardzo satysfakcjonujące. Dwie rzeczy zrobiły na mnie ogromne wrażenie: po pierwsze, twoja miłość do „budowania” — czuję, że jesteś jednym z najlepszych budowniczych; po drugie, twoja umiejętność obstawiania zakładów — odwaga, by stawiać ogromne zakłady. Myślę, że w tym tygodniu wszystkie te zakłady się zbiegają, więc zacznijmy od tego.
Mark: Dobrze. Robimy te rzeczy od dawna. Jeśli chodzi o AI, jako firma zajmujemy się tym niemal od samego początku — pierwsza wersja kanału informacyjnego była w pewnym sensie produktem uczenia maszynowego. Potem, około 15 lat temu, stworzyliśmy laboratorium badawcze AI.
Ale teraz weszliśmy w nową fazę — około roku temu uruchomiliśmy Meta Superintelligence Labs. Był to dość gruntowny restart badań, który sprowadził wielu wspaniałych specjalistów z całej branży, co jest ekscytujące. Obecnie widzimy, że modele stają się coraz lepsze, a następna generacja modeli wkrótce zostanie wydana, choć nie zostanie ogłoszona na Connect. Ponadto mamy osobistego asystenta Muse, który jak dotąd spotkał się z bardzo dobrym przyjęciem.
Budując te rzeczy, tak naprawdę nie wiesz, jak to wyjdzie. Nam samym się to podoba. Wcześniej w tym roku złożyłem Open Claw w domu po swojemu, aby poczuć, jak ta rzecz działa i jak przekształcić ją w magiczne doświadczenie, z którego może korzystać każdy.
Zasadniczo, kiedy my — ja, Nat i Alex — siedzieliśmy razem i zdaliśmy sobie sprawę, że to magiczne doświadczenie, i że gdybyśmy mogli przekształcić je w wersję gotową do użycia od razu, z której mogliby korzystać także zwykli ludzie, którzy nie znają się na technologii, nie chcą sami instalować Mac Mini, nie chcą grzebać w terminalu i nie chcą debugować, gdy coś pójdzie nie tak, poczułem, że będzie to coś, z czego będą chciały korzystać miliardy ludzi.
Od tego czasu pracujemy nad tym celem: dostrajamy modele specjalnie do tego, budujemy nie tylko samego asystenta i środowisko wykonawcze, ale także technologię, która zapewnia każdemu asystentowi niezależne środowisko obliczeniowe — zbudowaliśmy w tym celu całą bezpieczną maszynę wirtualną Muse.
Wewnętrznie zawsze uważaliśmy, że to coś wyjątkowego, a zespół wewnętrzny to uwielbiał, ale nigdy nie wiesz, jak ludzie zareagują po premierze produktu. Czasami zdarzają się przypadki, gdy od razu trafia się w dziesiątkę, ale najczęściej dostajesz trochę pozytywnych opinii i musisz dopracować kilka rzeczy, zanim produkt naprawdę „zaskoczy”. A tym razem „zaskoczył” od razu. To naprawdę ekscytujące, gdy tak się dzieje — w zaledwie dwa tygodnie miliony ludzi już z niego korzystają, co jest dość rzadkie. Z taką sytuacją spotykamy się tylko co kilka lat, ale to z pewnością jeden z najprzyjemniejszych momentów dla startupu.
Prowadzący: Naprawdę podziwiam twoją zdolność do pozostawania w grze i ciągłego próbowania. A trafianie home runa tak wiele razy jest naprawdę imponujące. W poprzednim wywiadzie z Joe Roganem, około trzy lata temu, wspomniałeś na końcu, że pewnego dnia będziesz mógł po prostu założyć okulary i pojawi się asystent AI. Więc czuję, że Muse już ma fizyczną formę, co jest bardzo mądre, ponieważ wydaje się to nieuniknione.
Mark: Myślę, że to również sprawia, że wydaje się to przyjaźniejsze i słodsze. Uważam, że zbyt wielu ludzi opisuje AI jako coś przerażającego, ale AI powinno być po prostu użyteczne i zabawne. Ta fizyczna forma—na wczesnym etapie projektu projektant stworzył tę postać i z jakiegoś powodu ciągle chcieli ją iterować, ale pierwsza wersja była najlepsza. Później ktoś powiedział: „Och, musi być niebieska, bo to Meta”. Powiedziałem: „Nie, myślę, że ta forma jest właściwa, za pierwszym razem trafiłeś w sedno”. I to wszystko, to po prostu zabawne.
Czym różni się osobista AI od ogólnej AI?
Prowadzący: Świetny szczegół. Jeśli chcesz, aby model wyróżniał się w sprawach osobistych, a nie tylko jako ogólny model inteligencji, jak różniłoby się podejście do treningu?
Mark: Myślę, że obecnie kluczowe jest uczynienie modelu doskonałym „agentem”. W ciągu ostatniego roku największym trendem były agenty kodujące, które zawierają dwie główne idee: ekspertyzę w kodowaniu i ogólną zdolność bycia świetnym agentem.
Nasza strategia polega na priorytetowym uczynieniu samego agenta świetnym, zamiast specjalizowania się w zdolnościach kodowania.
Zdolność kodowania jest ważna, ponieważ nawet jeśli użytkownicy nie myślą, że piszą kod, Muse zawsze pisze kod w tle, aby wykonać różne zadania. Ale uważamy, że agent powinien przede wszystkim być doskonałym agentem, a zdolność kodowania służy temu celowi.
Co więcej, przy budowaniu osobistego asystenta niektóre rzeczy są ważniejsze niż budowanie korporacyjnych produktów software'owych. Na przykład, jeśli budujesz korporacyjne narzędzie do kodowania, model nie musi mieć żadnego pojęcia o „granicach ujawniania informacji”—jakie informacje należy powiedzieć, a jakich nie. Ale dla Muse jest to bardzo ważne.
Musisz wytrenować tę zdolność w modelu, tak jak każdą inną zdolność. Mówisz mu wiele rzeczy, a potem chcesz, aby pomógł ci osiągnąć twoje cele. Na przykład chcesz, aby pomógł ci zarezerwować restaurację, szukasz odpowiedniej restauracji, ale możesz mieć jakąś alergię, albo jesteś w ciąży, i możesz nie chcieć ujawniać tego restauracji. Ale Muse będzie znać te informacje, i chcesz, aby wykonał zadanie, ujawniając jak najmniej informacji. To konkretna umiejętność, zasadniczo podstawowy ludzki zmysł społeczny.
Ale większość firm, które robią tylko agenty kodujące, nie wytrenowała tej zdolności w swoich modelach. My możemy to zrobić, ponieważ robimy full-stack—nie bierzemy istniejącego modelu od kogoś innego i nakładamy na niego framework; trenujemy cały model od zera, specjalnie pod te zdolności.
Model z pewnością potrzebuje szerokiej ogólnej inteligencji, ale ma również te konkretne zdolności. Następnie na tym budujesz całego asystenta i wszystkie szczegóły wokół niego: pamięć, środowisko wykonawcze oraz sposób, w jaki „odbija serce” — okresowo się budzi i sprawdza: „Dobrze, to są cele, które o tobie wiem, czy jest coś, co mogę teraz popchnąć do przodu?”
Mamy również dedykowany zespół skupiony wyłącznie na dopracowywaniu efektów animacji awatara w czasie rzeczywistym, ponieważ to nie jest tylko domyślny awatar — możesz dostosować dowolnego awatara, a on porusza się naturalnie, a efekt jest fantastyczny. Wprowadzamy również tryb głosowy, w którym możesz prowadzić rozmowy głosowe w czasie rzeczywistym, a twój asystent jest tuż obok ciebie. Te szczegóły, jak sądzę, wynikają z tego, że robimy full-stack — model i produkt są rozwijane razem.
Prowadzący: Inną dużą rzeczą jest maszyna wirtualna. Czy możesz wyjaśnić, dlaczego jest ważna i co odblokowuje?
Dlaczego Meta daje każdemu asystentowi AI własny komputer?
Mark: Zasadniczo, aby agent mógł coś dla ciebie zrobić, potrzebuje miejsca do przechowywania twoich informacji. Uważamy, że te informacje nie powinny być mieszane z informacjami wszystkich innych we wspólnej puli zasobów.
Pomyśl o tym w ten sposób: twój asystent będzie znał wiele wrażliwych informacji na twój temat. Wiele osób początkowo spotyka agentów takich jak OpenCloud, konfigurując Mac Mini w domu. Pomyśleliśmy więc, że wiele osób nie chce kupować Mac Mini ani konfigurować go samodzielnie. Jaki rodzaj doświadczenia najlepiej przybliżyłby ten efekt? Odpowiedź brzmi: po prostu pobierasz aplikację, rejestrujesz się i otrzymujesz komputer dedykowany tobie, aby twój asystent mógł pracować i przechowywać dane, oraz budujesz wokół tego model bezpieczeństwa. To przybliża posiadanie własnego komputera pod biurkiem — nawet my w Meta nie możemy uzyskać do niego dostępu.
Na przykład poufne maszyny wirtualne Muse — to funkcja, którą rozwijamy, i nawet my sami nie możemy zobaczyć zawartości twojej maszyny wirtualnej.
Zbudowaliśmy również wiele rzeczy wokół tego, takich jak bezpieczne przechowywanie poświadczeń — gdy twój asystent musi obsłużyć informacje takie jak hasła, sam nie musi widzieć tych haseł; wystarczy, że będzie mógł „wstawić” poświadczenia, gdy poprosisz go o zalogowanie się do określonej usługi, i zrobi to tylko wtedy, gdy wyraźnie o to poprosisz. System powinien być zaprojektowany w ten sposób: te informacje same w sobie nie powinny być swobodnie dostępne, ponieważ wypadki zawsze się zdarzają, ktoś może próbować się włamać lub system może mieć problemy.
Musisz więc zapewnić, że agent nie może uzyskać dostępu do tych danych, a Meta również nie może. Zapewnienie każdemu asystentowi niezależnego komputera i uczynienie bezpieczeństwa tak ekstremalnym, jak to możliwe, jest fundamentalnym fundamentem tej technologii — daje to zarówno Muse zdolności potrzebne do pomocy użytkownikom w osiąganiu ich celów, jak i zapewnia prywatność i bezpieczeństwo, czyniąc go światowej klasy, wiodącym w branży produktem w tej dziedzinie.
Prowadzący: Czy to oznacza, że podobnie jak w WhatsApp, dane na maszynie wirtualnej, do której łączy się Muse, są szyfrowane? Jak ludzie powinni rozumieć, jak dane są faktycznie przechowywane w maszynie wirtualnej?
Mark: Zasadniczo zbudowaliśmy dwie wersje. Muse Secure VM zawiera różne funkcje prywatności, w tym całą architekturę agenta Sentinel, którą zbudowaliśmy. Masz zwykłego asystenta Muse, który wykonuje dla ciebie zadania, a jednocześnie istnieje również agent bezpieczeństwa, którego nazywamy Sentinel, specjalnie monitorujący przepływ danych do i z twojego Muse.
Jeśli zewnętrzna zawartość spróbuje naruszyć bezpieczeństwo, Sentinel natychmiast to odetnie i powstrzyma przed wystąpieniem. Jeśli uzna, że twój Muse ma zamiar podjąć działanie wymagające twojej interwencji, przejmie kontrolę nad operacją Muse i wywoła alert, aby osoba potwierdziła pozwolenie — na przykład: „Czy chcesz, aby Muse mógł to zrobić?”
Cały ten system, plus bezpieczne przechowywanie poświadczeń, plus wiele warstw obrony w głąb, razem tworzą Muse Secure VM.
Rozwijamy również inny projekt. Nat i ja specjalnie zrekrutowaliśmy Moxie’ego Marlinspike’a — tę samą osobę, która współpracowała z nami wtedy przy wdrażaniu szyfrowania end-to-end w WhatsApp — do zaprojektowania Muse Confidential VM. Główna idea jest taka, że oprócz bezpiecznej maszyny wirtualnej otrzymujesz również dedykowany klucz szyfrowania, dzięki czemu nawet Meta nie może uzyskać dostępu do zawartości wewnątrz.
Ta wersja jest trudniejsza do wdrożenia, ponieważ jeśli Meta nie może uzyskać dostępu do wnętrza maszyny wirtualnej, debugowanie i zapewnienie prawidłowego działania systemu staje się znacznie trudniejsze. Dlatego poświęciliśmy temu trochę czasu, ale wkrótce zostanie uruchomiona. Osiągnie to zasadniczo standard bezpieczeństwa, który ludzie już znają z WhatsApp i innych naszych najbezpieczniejszych produktów.
Prowadzący: Czy zaletą robienia tego jest tylko sprawienie, że ludzie czują się psychicznie bezpieczniej, czy są z tego rzeczywiste korzyści?
Mark: Myślę, że samo bezpieczeństwo jest ważne. Naszym celem jest zbliżenie się do dania ci lokalnej maszyny pod biurkiem. Co daje ci ta lokalna maszyna? Oznacza, że żadna firma nie może uzyskać do niej dostępu.
Więc zakładając, że Meta chce zapewnić ci tę usługę, jak możemy dać ci taki sam poziom gwarancji prywatności i bezpieczeństwa, aby żadna firma — czy to Meta, czy ktokolwiek próbujący się do nas włamać, czy w niektórych krajach, w których nie ufasz lokalnemu rządowi — nie mogła uzyskać dostępu? Ponieważ my sami też nie możemy wejść, bo nie mamy dostępu.
Myślę, że to jest bardzo ważne i jest to również ważny powód, dla którego ludzie ufają WhatsApp. To jest prawdziwa wartość dla prywatności, bezpieczeństwa i zaufania.
Jeśli masz mieć asystenta, który wie o tobie wszystko — przypuszczam, że prawie wszyscy będziemy mieli takiego asystenta — przenieśmy się 5 lat w przyszłość, każdy będzie miał asystenta, który dogłębnie rozumie twoje cele i wszystko, i może pomóc ci załatwić sprawy. W tej sytuacji bycie liderem branży w zakresie prywatności i bezpieczeństwa jest bardzo ważne. Chcieliśmy to zrobić od samego początku.
Jak kształtować osobowość AI?
Prowadzący: Jest jeszcze jedna bardzo interesująca rzecz — studiowałeś psychologię na uniwersytecie.
Mark: Cóż, byłem tam tylko przez bardzo krótki czas, dwa lata, ale czuję, że wpłynęło to na wiele rzeczy, które później zbudowałem.
Prowadzący: Kiedy patrzymy na modele, często mówimy, że dany model jest „bardzo inteligentny”. Ale tak jak wybieramy przyjaciół, to z pewnością dlatego, że są inteligentni, a także dlatego, że lubimy ich energię i sposób, w jaki się dogadujemy. Jak myślisz o kształtowaniu osobowości modelu?
Mark: Myślę, że idealny model powinien być wystarczająco adaptacyjny, aby dopasować się do stylów różnych osób. Uważam, że wiele osób w branży się co do tego myli — wiele innych laboratoriów skupia się na „jak dobrze zaprojektować osobowość”, ale ja nigdy nie uważałem, że osobowość jest czymś stałym. To jeden z powodów, dla których tak mocno wierzę w open source, tak mocno wierzę, że ludzie mogą dostosowywać, i dlatego zaprojektowaliśmy Muse jako wysoce osobisty produkt.
Możesz dostosować i spersonalizować Muse — nie tylko wygląd i głos. Kiedy po raz pierwszy się rejestrujesz, pierwszą rzeczą, o którą pyta, jest „jaka ma być moja podstawowa osobowość”, a możesz ją zmienić w dowolnym momencie.
Staramy się, aby model był wysoce sterowalny, dzięki czemu możesz zdefiniować rodzaj interakcji, jakiej chcesz. To ważna część tego, co czyni go doskonałym osobistym asystentem — ta adaptacyjność wokół osobowości jest kluczowa.
Prowadzący: Jaki styl ma twój własny Muse?
Mark: Zrobiłem go bezpośrednim i nastawionym na wydajność. To całkiem interesujące. Wcześniejsze wersje były bardzo sarkastyczne i humorystyczne, ale obecna wersja jest bardziej bezpośrednia. Mój asystent używa domyślnego wyglądu Muse, ale ubrałem go w togę i nadałem mu głęboki, nieco komiczny głos. Interakcja z nim jest zabawna.
Prowadzący: Myślę, że aby mieć poczucie humoru, trzeba być naprawdę inteligentnym. Wiele osób nie zdaje sobie sprawy, że komicy to jedni z najinteligentniejszych ludzi w społeczeństwie — szybkie reakcje, wystarczająca błyskotliwość. Zdecydowanie masz tę cechę. Oglądając wszystkie twoje wywiady, zawsze wypadałeś dobrze.
Nieoczekiwane przewidywania Marka dotyczące AI i metawersum
Prowadzący: W twoim wywiadzie z Theo dużo mówiłeś o następnej granicy technologii i tym, dokąd to wszystko ostatecznie zmierza. Dziedzina AI przeszła kilka „zim”, kiedy ludzie myśleli, że nie będzie przełomów. Metawersum również przeszło kilka takich okresów, kiedy wszyscy myśleli, że to zakład, którego nie da się zrealizować. Wczoraj wypróbowałem nową funkcję holograficznego awatara, jest bardzo fajna. W wywiadzie z Lexem wydawało się, że nagranie twojej twarzy zajmie 11 godzin, teraz zajmuje to tylko 3 minuty. Jak to posunęło się do tego, gdzie jest dzisiaj?
Mark: W ogólnym rozwoju metawersum, kiedy założyliśmy Reality Labs, zawsze wierzyliśmy, że ostatecznie pojawią się zwykłe okulary o normalnym wyglądzie, a z czasem będą mogły zarówno zapewnić immersyjną obecność, jak i stać się doskonałymi urządzeniami AI — ponieważ okulary to jedyna forma, która pozwala urządzeniu widzieć to, co ty widzisz, słyszeć to, co ty słyszysz, komunikować się z tobą przy twoim uchu przez cały dzień, a ostatecznie wyświetlać obrazy.
Ale 10 do 15 lat temu zakładałem, że najpierw osiągniemy technologię holograficzną, a potem wysoce rozwiniętą sztuczną inteligencję. Jednak ścieżka ewolucji technologicznej jest interesująca — w rzeczywistości najpierw otrzymaliśmy AI i osobistą superinteligencję, a następnie technologię, która uczyniła holografię powszechną i wystarczająco przystępną cenowo. Tego nie przewidziałem, ale cieszę się, że pracujemy w obu kierunkach.
Nasze znaczące inwestycje w okulary postawiły nas w bardzo korzystnej pozycji, gdy asystenci AI będą gotowi. Wiele ogłoszeń na Connect dotyczyło właśnie wprowadzenia Muse i wielu funkcji AI do okularów i myślę, że użytkownicy naprawdę to polubią. To wielka sprawa.
Jeśli chodzi o obecność, wciąż robimy postępy, ale postęp jest stosunkowo wolniejszy, ponieważ większość naszej energii przesunęła się na budowanie Muse i funkcji AI dla okularów. Mamy jednak długotrwały projekt dotyczący awatarów w czasie rzeczywistym o wysokiej wierności.
Jak powiedziałeś, trzy lub cztery lata temu potrzebowałeś całego pokoju skanowania, aby nagrać osobę ze wszystkich kątów, a następnie potrzebowałeś procesorów graficznych klasy korporacyjnej do renderowania, co było bardzo uciążliwe. Demo, które zrobiliśmy dla podcastu Lex, było właśnie takim rozwiązaniem. Teraz zasadniczo udało nam się to uruchomić w parze okularów VR — to pierwsza forma okularów, która może osiągnąć tak niesamowite doświadczenie VR, a nie duży zestaw słuchawkowy. Wystarczy kilka zdjęć, aby stworzyć swojego awatara, a postęp jest zdumiewający.
Prowadzący: I może również sterować mimiką na podstawie głosu. W demie rozśmieszyło mnie, pozwoliło mi wchodzić w interakcje, a następnie zrozumiało, jak porusza się moja twarz wraz ze ścieżką audio. Wspomniałeś w tamtym podcaście, że niektórzy ludzie, którzy zwykle są bardziej powściągliwi w wyrażaniu emocji, w rzeczywistości chcą bogatszej mimiki w wirtualnym świecie. Jak postrzegasz rozróżnianie przez ludzi ich „wirtualnego ja” i „prawdziwego ja”?
Mark: Myślę, że jesteśmy jeszcze bardzo wcześnie w rozumieniu socjologii i psychologii tego zjawiska. Uważam, że postrzeganie siebie przez ludzi i wizerunek, który chcą projektować, często różnią się nieco od tego, kim naprawdę są. Od narodzin sieci społecznościowych ludzie starannie wybierali awatary. W przypadku awatarów Muse zaobserwowaliśmy podobne zjawisko. Nie tyle „kuratorowanie” siebie, ile „kuratorowanie” „osoby”, z którą chcesz się komunikować.
Myślę, że kiedy dajesz ludziom możliwość wyrażania siebie, chcesz, aby naprawdę ich uchwyciła, a jednocześnie sama w sobie jest formą ekspresji, nie tylko czystym odbiciem lustrzanym — jest zarówno komunikacją, jak i ekspresją. Mamy nadzieję zbudować coś, co równoważy oba aspekty. To zawsze iteracyjna pętla: zobacz, jak ludzie tego używają, a potem ulepszaj. Po latach pracy jesteśmy teraz naprawdę na linii startu — po raz pierwszy możemy naprawdę wprowadzić całkiem wysokiej jakości realistyczne awatary do produktów, użytecznych na telefonach i w VR. Jestem bardzo podekscytowany, mogąc zobaczyć rezultaty.
Jak będzie wyglądać 2030 rok?
Prowadzący: Dobrze, zabierz mnie do swojego myślenia, przenieś się szybko do 2030 roku, jeśli wszystko pójdzie dobrze, jak będzie wyglądać strona technologii holograficznej? Hologramy plus Muse, plus okulary, jak to wszystko się połączy?
Mark: Moje rozumienie wizji metawersum zawsze dotyczyło skutecznego łączenia świata fizycznego ze światem cyfrowym. Podstawowa idea jest taka: mamy ten wspaniały świat fizyczny, a jednocześnie mamy również wspaniały świat cyfrowy—ogromną ilość treści zgromadzonych w internecie przez 20 do 30 lat, co zapiera dech w piersiach. Ale sposób, w jaki uzyskujemy do nich dostęp, polega albo na siedzeniu przy biurku, albo przez mały ekran w kieszeni, co jest zasadniczo bardzo ograniczone.
Myślę, że najbardziej idealną wersją tego jest płynne połączenie świata fizycznego i cyfrowego. Pomyśl o tym w ten sposób: teraz we dwoje jesteśmy tutaj. W jakiejś przyszłej wersji jedno z nas może być holograficzną projekcją, ale nadal czujesz, że druga osoba jest naprawdę obecna, co jest zupełnie inne niż rozmowa wideo.
A rdzeniem wirtualnej rzeczywistości jest właśnie dostarczanie tego poczucia obecności—sprawianie, że naprawdę czujesz, iż jesteś w tym samym pokoju z innymi, lub w innym miejscu. Możesz to osiągnąć za pomocą technologii holograficznej i mieszać to na różne sposoby. Na przykład mogę zagrać w pokera z przyjaciółmi, z których niektórzy są obecni, a inni dołączają przez holograficzne awatary, i oni również mogą grać w karty, a sam stół do kart może być również holograficzny, tak aby ci, którzy nie są obecni, mogli również być w to zintegrowani.
Jednocześnie AI może również otrzymać formę fizyczną i pojawić się w tej scenie. W scenariuszach pracy ma to ogromny sens—już stale używam różnych agentów kodujących do budowania rzeczy. Wyobraź sobie: masz kanał czatu grupowego z kilkoma osobami i kilkoma agentami, i przydzielasz zadania agentom. Ale czasami wszyscy zbierają się na spotkanie, a agenci powinni być może również być obecni. Jak się pojawiają? Proste, po prostu dodaj kilka dodatkowych miejsc na kanapie, i pojawiają się jako holograficzne awatary. Albo użyj tej uroczej małej postaci Muse, albo smoka, albo dowolnego dziwnego i osobliwego obrazu, który stworzysz.
Przypuszczam, że w przyszłości będzie to całkiem naturalne.
Prowadzący: Interesujące. W twoich poprzednich wywiadach mówiłeś, że branża technologiczna często zapomina o „zabawie”. Myślę, że pojawienie się tam fizycznego asystenta również sprawiłoby, że poczucie byłoby bardziej realne—jakby praca była naprawdę zlecana na zewnątrz. Kiedy widzisz, jak Muse pisze, czujesz, że coś naprawdę się dzieje. To jest zrobione bardzo dobrze—możliwość zobaczenia, co dzieje się w przeglądarce. Więc czy myślisz, że taki scenariusz jest możliwy: zakładasz okulary, a następnie kontrolujesz swój komputer, pozwalając Muse robić rzeczy za ciebie na komputerze?
Mark: Och, zdecydowanie. VR już to potrafi. Możesz po prostu znaleźć miejsce, aby usiąść, kawiarnia jest w porządku, a następnie otworzyć swoje stanowisko pracy, z sześcioma monitorami, pisać na nich kod, wszystko tam jest.
Jeśli chodzi o okulary, najpopularniejszy obecnie model nie ma wyświetlacza, co z jednej strony czyni go bardziej przystępnym cenowo i pozwala większej liczbie osób z niego korzystać, a z drugiej strony wciąż pracujemy nad tym, aby zmieścić wyświetlacz w najbardziej kompaktowej formie. Ale już wydaliśmy wersję Meta Ray-Ban z wyświetlaczem, która jest bardzo popularna, i to jest mały wyświetlacz. Wydaliśmy również prototypową wersję holograficznej AR z pełnym polem widzenia, co, jak myślę, będzie bardzo ekscytujące.
Więc cała linia produktów wygląda tak: od okularów czysto audio—bez kamery, wyglądających jak zwykłe okulary, ale z Muse w środku, pozwalających korzystać z różnych narzędzi audio, słuchać muzyki, dzwonić—po wersje wyższej klasy, wszystkie istnieją.
Prowadzący: Zastanawiam się, czy w przypadku tych okularów audio możesz rozmawiać z Muse, podczas gdy twój domowy komputer wykonuje różne zadania?
Mark: Tak, absolutnie. Właśnie wydaliśmy tę funkcję na konferencji Connect.Teraz wszystkie okulary są połączone z Meta AI, co jest doświadczeniem „pojedynczej tury” — wysyłasz zapytanie, odpowiada i to wszystko. Ale z Muse zasadniczo ulepszymy wszystkie okulary do Muse. Po pierwsze, nie musisz już mówić „Hej Meta”, możesz nadać mu dowolne imię, co samo w sobie jest częścią zabawy. Potem po prostu rozmawiasz z nim bezpośrednio, a on łączy się z twoim Muse, a twój Muse zajmuje się zadaniami w twojej bezpiecznej maszynie wirtualnej, pomagając ci załatwiać sprawy.
Host: To niesamowite!
Mentalność założyciela
Host: Dobrze, jesteśmy teraz tutaj, Muse rozwija się gładko, a okulary również radzą sobie dobrze, ale około rok temu wielu ludzi pytało „co dokładnie stało się z laboratorium superinteligencji”. W tamtym momencie, co czułeś w środku? Kiedy sprawy nie idą dobrze, ale nadal widzisz długoterminową wizję, jakie to doświadczenie?
Mark: To, co naprawdę poszło nie tak, to projekt Llama i Llama 4.
Llama 1 był całkiem interesującym modelem, zapoczątkował cały ruch otwartego AI i jesteśmy z tego bardzo dumni. Llama 2 osiągnęła skalę, Llama 3 była dobrym modelem, prawie na granicy ówczesnych możliwości. Potem przyszła Llama 4 i zasadniczo odeszliśmy od trajektorii, na której powinniśmy byli być.
Zawsze, gdy sprawy nie idą tak, jak oczekuję, spędzam dużo czasu myśląc: dlaczego tak się stało? Co musimy zmienić, aby robić lepiej? Tym razem moja refleksja była taka: źle ustawiłem całą strukturę zespołu.
Umodelowałem to tak, jak robimy prace związane z uczeniem maszynowym, takie jak kanał na Instagramie czy systemy reklamowe — z setkami, a nawet tysiącami ludzi pracujących równolegle nad wieloma rzeczami. Ale przy budowaniu modeli językowych tak naprawdę potrzebujesz niezwykle zwartego małego zespołu, traktując to jako grupowy projekt naukowy. Nie potrzebujesz wielu ludzi, ale to oznacza, że każde miejsce w zespole jest niezwykle cenne.
Więc zebraliśmy najlepszych ludzi z całego Meta, a jednocześnie sprowadziliśmy wielu błyskotliwych ludzi z całej branży, tworząc zupełnie nowy zespół — Meta Superintelligence Labs.
Z mojej perspektywy, gdy MSL startowało, wiedziałem, że zajmie trochę czasu, aby zrestartować, odbudować infrastrukturę i wytrenować następną generację modeli. Ale wiedziałem, że zebraliśmy doskonały zespół, a jeśli zespół się zgra i będzie działał dobrze, wyniki będą dobre.
Dla mnie najbardziej ekscytującym momentem, był właściwie okres po wydaniu Llama 4 — myślałem, że jesteśmy na dobrej drodze, ale okazało się, że nie. To była dość duża negatywna niespodzianka. Myślę, że jako przedsiębiorca zawsze jesteś testowany w takich momentach, ponieważ nieuchronnie nie wszystko pójdzie gładko. A to, co naprawdę determinuje trajektorię, to: gdy sprawy nie idą tak, jak chcesz, jak znajdujesz drogę naprzód.
Host: Domyślam się, że odwrotność też jest prawdziwa — gdy coś znacznie przekracza twoje oczekiwania, jak premiera Muse, jak upewniasz się, że możesz wykorzystać tę okazję?
Mark: Dokładnie. Teraz cała firma jest w pełni zaangażowana—na początku był to tylko mały zespół budujący produkt, ale teraz wszyscy zdają sobie sprawę, że to naprawdę jest gotowe na wielką scenę. Cała firma myśli o tym, jak uczynić tę rzecz wielką, jak pozwolić setkom milionów ludzi jej doświadczyć.
Od optymalizacji całej infrastruktury, aby wszystko działało płynnie i wyciśnięcia każdego kawałka mocy obliczeniowej z istniejących GPU, po różne zespoły produktowe osadzające Muse na różne sposoby—na przykład w okularach. Widok wszystkich pracujących razem, aby zapewnić, że Muse może skalować się płynnie, to wspaniałe uczucie.
Jak Mark pisze i komunikuje wizję
Host: Jako założyciel czuję, że to moment, na który najbardziej czekasz—wszystko się układa. Jak komunikujesz wizję firmie? Przy tak wielu rzeczach pushowanych jednocześnie, czuję, że dużo piszesz. Jaki jest twój proces?
Mark: Pisanie bardzo mi pomaga, zarówno w dopracowywaniu własnych myśli, jak i w komunikacji zewnętrznej. Tego lata napisałem bardzo długi tekst zatytułowany "Przyszłość należy do wszystkich", około 15 stron, który pomógł mi systematycznie








