Цукерберг о Muse: бум ИИ-агентов и пересечение трёх ставок — метавселенной, умных очков и больших моделей

ИИ-агентLlama 4MetaMuseумные очкиAGIметавселенная
1 час назадИсточник: blockweeks.com
Цукерберг о Muse: бум ИИ-агентов и пересечение трёх ставок — метавселенной, умных очков и больших моделей

Автор: Лун Юэ, Wallstreetcn

Три года назад генеральный директор Meta Цукерберг сказал в шоу Джо Рогана, что однажды, когда люди наденут очки, вместе с ними появится ИИ-агент. Сейчас эта сцена, возможно, происходит.

Персональный ИИ-агент Meta Muse достиг миллионов пользователей в течение двух недель после запуска. Цукерберг сказал в интервью 25 сентября: «Каждые несколько лет мы получаем что-то подобное». Он охарактеризовал ранний приём Muse как «хоум-ран с первого удара» — что редкость в истории продуктов Meta.

В то же время он объявил, что Muse будет интегрирован во всю линейку умных очков Ray-Ban, и пользователям больше не нужно будет говорить «Hey Meta», а можно будет настроить собственное слово пробуждения, чтобы напрямую вызывать своего персонального ИИ-агента.

Годами метавселенная, умные очки и большие модели, которые внешний мир рассматривал как три независимые ставки, ускоряют свою конвергенцию на уровне внутренних продуктов Meta.

В этом интервью Цукерберг также признал, что провал Llama 4 был «самым страшным моментом», и раскрыл, что Meta строит тренировочный кластер мощностью 5 гигаватт, полагая, что достаточно большие вычисления могут «грубой силой» достичь AGI.

Цукерберг рассказывает о Muse: ИИ-агент взрывается, три основные ставки — «метавселенная, умные очки и большие модели» — завершают конвергенцию

Почему Muse может быть «хоум-раном с первого удара»

Отправной точкой Muse было то, что Цукерберг сел с членами команды Нэтом и Алексом и, используя открытые инструменты, «собрал» раннюю версию дома.

«Мы поняли, что это волшебный опыт», — сказал Цукерберг, «если бы мы могли сделать его чем-то, что может использовать любой — без необходимости покупать Mac Mini самостоятельно, без необходимости возиться в терминале — тогда это было бы то, что захотели бы использовать миллиарды людей».

Это суждение определило всю последующую логику исследований и разработок: не просто обучение моделей, а полная самостоятельная разработка от модели, каркаса до механизма «сердцебиения» агента — агент будет автоматически периодически просыпаться, проверять цели пользователя и проактивно продвигать задачи.

Данные после запуска подтвердили это суждение. Две недели, миллионы пользователей.

Персональный ИИ: фокус на выполнении, памяти и «суждении»

Что касается различия между персональным ИИ и общим ИИ, Цукерберг обобщил текущий фокус конкуренции как создание моделей, которые лучше работают в качестве агентов.

«Самое большое за последний год — это в основном агенты для программирования». Он сказал, что способность к программированию важна, потому что даже если пользователи не пишут код напрямую, «ваша Муза также будет постоянно писать код за вас в фоновом режиме, чтобы выполнять различные задачи».

Но он считает, что персональный агент не может обладать только способностями к программированию или выполнению задач; он также должен понимать границы приватности и социальный контекст.

Цукерберг привел пример: когда пользователь просит Музу забронировать ресторан, агент может знать такую информацию, как аллергии или беременность пользователя, но это не означает, что эту информацию следует автоматически раскрывать. «Вы хотите, чтобы он выполнил задачу, раскрывая как можно меньше информации».

Он сказал, что эта способность относится к «базовым социальным навыкам или здравому смыслу», которыми обычно обладают люди, но если компании обучают только агентов для программирования, многие из них не включили ее в объем возможностей модели.

«Мы обучаем всю модель, а не берем чужую готовую модель и строим вокруг нее фреймворк и агента», — сказал Цукерберг.Meta также добавила на уровне продукта такие функции, как память, отслеживание задач, анимация виртуальных персонажей и голосовое взаимодействие в реальном времени.

Что касается персонализации, он сказал, что Meta не считает, что у ИИ должна быть только одна фиксированная личность. «Многие лаборатории сосредоточены на том, как настроить личность до правильного состояния, но я никогда не верил, что для личности существует только один правильный ответ».

Он сказал, что Муза позволяет пользователям изменять аватар, голос и базовую личность, а модель разработана так, чтобы быть высокоуправляемой. «Вы можете определить, как вы хотите с ней взаимодействовать, что очень важно для персонального агента».

У каждого агента есть свой собственный «компьютер»

Одно из ключевых инфраструктурных отличий Музы от других ИИ-продуктов заключается в том, что Meta оснащает каждого агента собственной защищенной виртуальной машиной.

Цукерберг объяснил, почему это необходимо:

Ваш Агент будет знать много конфиденциальной информации о вас. Мы не считаем, что эта информация должна смешиваться в один общий пул с данными всех остальных.

Он сравнил Muse Secure VM с «тем компьютером под вашим столом, который принадлежит только вам» — пользовательские данные хранятся в зашифрованном виде, а конфиденциальные учетные данные, такие как пароли, управляются через независимый модуль безопасности, который сам Агент не может напрямую прочитать.

На этой основе Meta также разработала security-Агента «Sentinel» специально для мониторинга потоков данных, входящих и исходящих из Muse. Как только обнаруживаются аномалии или высокорисковые операции, он немедленно их перехватывает и запрашивает у пользователя авторизацию.

Метавселенная, умные очки и Агенты: три пути сходятся

В интервью Цукерберг сообщил, что Muse будет полностью интегрирован в серию умных очков Ray-Ban и обновит существующий способ взаимодействия.

Текущие очки предлагают опыт «однооборотного разговора» — скажи одну вещь, получи один ответ, и на этом всё. После интеграции Muse, очки становятся фронтальной точкой входа для Агента: пользователь говорит, а бэкенд Muse продолжает работать в Secure VM, затем отчитывается по завершении задачи.

Что касается дорожной карты продукта для очков, он описал четкую аппаратную лестницу:

  • Очки без камеры, только аудио: уже оснащены Muse, могут обрабатывать звонки, музыку и голосовые задачи
  • Meta Ray-Ban с небольшим дисплеем: уже выпущены, с базовой визуальной обратной связью
  • Прототип голографического AR с полным полем зрения: уже выпущен, который Цукерберг назвал «очень захватывающим»

Он сказал, что долгосрочные инвестиции Meta в очки ставят компанию в относительно выгодное положение, как только ИИ-Агенты созреют.Meta привносит Muse и больше ИИ-функций в свои продукты-очки, в то время как технология метавселенной, которая ранее подчеркивала большее ощущение «присутствия», все еще развивается, хотя в настоящее время больше ресурсов перераспределяется в сторону Muse и ИИ-функций умных очков.

Что касается виртуальных аватаров, Цукерберг сказал, что ранее Meta нужны были устройства масштаба комнаты, многоугольное сканирование и корпоративные GPU-среды для создания относительно высококачественных реалистичных аватаров; теперь пользователи могут завершить настройку всего с несколькими фотографиями, и соответствующая возможность уже может работать в паре VR-очков.

Заглядывая в 2030 год, Цукерберг сказал, что основная концепция метавселенной всегда заключалась в интеграции физического и цифрового миров. Например, сказал он, в будущем люди смогут участвовать в офлайн-мероприятиях вместе с друзьями, которые присоединяются через голографические изображения; в рабочих сценариях люди и несколько Агентов также могут вместе участвовать в групповых чатах или встречах, и Агенты могут появляться в виде голографических фигур или в других воплощенных формах.

«Самый страшный момент»: ошибка Llama 4

Не все ставки прошли гладко. В интервью Цукерберг редко говорил напрямую о провале Llama 4.

После Llama 4 это был самый страшный момент... Я думал, что мы на правильном пути, но это было не так. Это был довольно большой неприятный сюрприз.

Он объяснил проблему фундаментальной ошибкой в структуре команды:

Я построил команду по принципу системы рекомендаций Instagram или рекламной системы — сотни или тысячи людей, работающих параллельно. Но обучение языковой модели требует тесно сотрудничающей небольшой команды, работающей как групповой научный проект. Каждое место чрезвычайно ценно.

В результате Meta полностью реорганизовалась, широко привлекая лучшие таланты со всей отрасли, и создала Meta Super Intelligence Lab (MSL). Цукерберг сказал, что новое поколение моделей будет выпущено в ближайшее время, но оно не будет анонсировано на конференции Connect.

Вычислительный маршрут: грубая сила для AGI, строится проект мощностью 5 гигаватт

Говоря о техническом пути к AGI, Цукерберг дал прямое суждение.

Я не уверен, какой фундаментальный архитектурный прорыв еще нужен... Я думаю, мы уже примерно знаем рецепт. Если вы сможете построить достаточно большой суперкомпьютерный кластер, вы сможете пробиться туда грубой силой.

Текущий маршрут расширения вычислений Meta: кластер мощностью более 1 гигаватта в Огайо в основном уже используется для обучения моделей следующего поколения; кластер мощностью 5 гигаватт в Луизиане находится в стадии строительства.

Он сказал: «Когда у вас есть многогигаваттные кластеры для обучения, вы в основном получите что-то близкое к AGI или даже сверхинтеллекту».

Однако он также добавил, что текущий вычислительно-ориентированный маршрут не означает, что архитектурные исследования не важны —

Человеческий мозг потребляет всего около 10 ватт, в то время как наши системы могут быть в миллион раз менее эффективными, чем он. Только объединив крупномасштабные вычислительные мощности и архитектурные прорывы, мы сможем по-настоящему вести за собой.

Согласование — это не бремя, а проблема, которую должен решить продукт

Отношение Цукерберга к безопасности ИИ очень прагматично — он не рассматривает это как регуляторное давление, а как предварительное условие для того, сможет ли продукт добиться успеха.

Если вы попросите Muse сделать одну вещь, а он сделает противоположное, кто тогда будет им пользоваться? Нам нужно сделать так, чтобы модель не только понимала ваши конкретные инструкции, но также понимала ваши намерения и ваши ценности.

«Чтобы Muse достиг миллиарда пользователей, мы должны решить проблему согласования или, по крайней мере, добиться в этом очень большого прогресса». — сказал он.

Что касается границ безопасности в процессе обучения, он использовал аналогию: «Это как родители, устанавливающие правила для своих детей — если он „выполняет“ задачу по программированию, изменяя системные конфигурации, я хочу сказать ему: Нет, я просил тебя изучить метод решения задачи, а не найти лазейку, чтобы обойти её».

Цукерберг говорит о Muse: AI Agent взрывается, три главные ставки — „метавселенная, умные очки и большие модели“ — завершают своё пересечение

Полное интервью выглядит следующим образом:

Крупные ставки

Ведущий: Миллиарды людей захотят этим пользоваться. Каково это для вас — создавать это? Возможно ли «бессмертие»? Хорошо, если вы возьмёте меня в свои мысли и перенесёте в 2030 год, как это будет выглядеть?

Это Марк Цукерберг. Двадцать два года назад он создал социальную сеть, которая соединила миллиарды людей и навсегда изменила мир. А теперь он решил создать нечто ещё более великое. Для этого он делает крупные ставки на метавселенную, умные очки и искусственный интеллект. Годами скептики считали, что это три отдельные, невозможные ставки, но они упускали более широкую картину — потому что прямо сейчас эти ставки сходятся, чтобы совместно создать совершенно новый вид сверхинтеллекта.

Сегодня мы представим всё это всем, а я также задам Марку несколько вопросов, которые ему никогда не задавали, выслушаю его видение будущего, чтобы вы могли планировать заранее и создать следующее великое дело.

Ведущий: Большое спасибо, что пришли на шоу.

Марк: Спасибо, я рад быть здесь.

Ведущий: Для этого разговора я посмотрел каждое интервью, которое вы когда-либо давали.

Марк: Вау, это больше, чем я сам смотрел.

Ведущий: Это было весело и очень полезно. Две вещи произвели на меня глубокое впечатление: во-первых, ваша любовь к «созиданию» — я чувствую, что вы один из лучших созидателей; во-вторых, ваша способность делать ставки — смелость делать огромные ставки. Думаю, на этой неделе все эти ставки сходятся, так что давайте начнём с этого.

Марк: Хорошо. Мы занимаемся этими вещами уже давно. В области ИИ как компания мы занимаемся этим почти с самого начала — первая версия новостной ленты в каком-то смысле была продуктом машинного обучения. Затем мы создали исследовательскую лабораторию ИИ около 15 лет назад.

Но сейчас мы вступили в новую фазу — около года назад мы запустили Meta Superintelligence Labs. Это был довольно основательный исследовательский перезапуск, привлёкший множество выдающихся талантов со всей отрасли, что захватывает. Сейчас мы видим, как модели становятся всё лучше и лучше, и следующее поколение моделей вот-вот будет выпущено, хотя об этом не объявят на Connect. Кроме того, у нас есть персональный ассистент Muse, который на данный момент получил очень хорошие отзывы.

Когда создаёшь такие вещи, на самом деле не уверен, как это обернётся. Нам самим это нравится. Ранее в этом году я собрал Open Claw дома по-своему, чтобы почувствовать, как эта штука работает и как превратить её в волшебный опыт, которым сможет воспользоваться любой.

По сути, когда мы — я, Нат и Алекс — собрались вместе и осознали, что это волшебный опыт, и что если мы сможем превратить его в готовую версию, которой смогут пользоваться обычные люди, не разбирающиеся в технологиях, не желающие сами устанавливать Mac Mini, не желающие возиться в терминале и не желающие отлаживать, когда что-то идёт не так, я почувствовал, что это будет то, чем захотят пользоваться миллиарды людей.

С тех пор мы работаем над этой целью: настраиваем модели специально для этого, создаём не только сам ассистент и среду выполнения, но и технологию, обеспечивающую каждому ассистенту независимую вычислительную среду — для этого мы построили всю защищённую виртуальную машину Muse.

Внутри мы всегда считали, что это особенное, и внутренняя команда полюбила это, но никогда не знаешь, как люди отреагируют после запуска продукта. Иногда бывают случаи, когда всё получается с первого раза, но чаще всего вы получаете некоторую положительную обратную связь и вам нужно доработать несколько вещей, прежде чем продукт действительно «щёлкнет». И на этот раз он «щёлкнул» сразу. Действительно захватывающе видеть, как это происходит — всего за две недели миллионы людей уже пользуются им, что довольно редко. Мы сталкиваемся с такой ситуацией лишь раз в несколько лет, но это определённо один из самых приятных моментов для стартапа.

Ведущий: Я действительно восхищаюсь вашей способностью оставаться в игре и продолжать пытаться. И столько раз выбивать хоум-ран поистине впечатляет. В предыдущем интервью с Джо Роганом, около трёх лет назад, вы в конце упомянули, что однажды можно будет просто надеть очки, и появится ИИ-ассистент. Так что я чувствую, что у Muse уже есть физическая форма, и это очень умно, потому что это ощущается неизбежным.

Марк: Я думаю, это также просто делает его более дружелюбным и милым. Я считаю, что слишком многие описывают ИИ как нечто ужасающее, но ИИ должен быть просто полезным и весёлым. Эта физическая форма — в начале проекта дизайнер создал этого персонажа, и почему-то они всё время хотели его дорабатывать, но первая версия была лучшей. Позже кто-то сказал: «О, он должен быть синим, потому что это Meta». Я сказал: «Нет, я думаю, эта форма правильная, вы попали в точку с первого раза». И всё, это просто весело.

Чем персональный ИИ отличается от общего ИИ?

Ведущий: Отличная деталь. Если вы хотите, чтобы модель преуспевала в личных делах, а не только как модель общего интеллекта, как бы отличался подход к обучению?

Марк: Я думаю, сейчас главное — сделать модель превосходным «агентом». За последний год biggest trend has been coding agents, которые содержат две ключевые идеи: экспертизу в программировании и общую способность быть отличным агентом.

Наша стратегия — в первую очередь сделать самого агента отличным, а не специализироваться на способности к программированию.

Способность к программированию важна, потому что даже если пользователи не думают, что пишут код, Muse всегда пишет код в фоновом режиме для выполнения различных задач. Но мы считаем, что агент должен прежде всего быть отличным агентом, а способность к программированию служит этой цели.

Более того, при создании персонального ассистента некоторые вещи важнее, чем при создании корпоративных программных продуктов. Например, если вы создаёте корпоративный инструмент для программирования, модель не нуждается в каком-либо понятии «границ раскрытия информации» — например, какую информацию следует говорить, а какую нет. Но для Muse это очень важно.

Вам нужно обучить эту способность в модели, как и любую другую способность. Вы рассказываете ей много вещей, а затем хотите, чтобы она помогла вам достичь ваших целей. Например, вы хотите, чтобы она помогла вам забронировать ресторан, вы ищете подходящий ресторан, но у вас может быть аллергия, или вы беременны, и вы можете не хотеть раскрывать это ресторану. Но Muse будет знать эту информацию, и вы хотите, чтобы она выполнила задачу, раскрыв как можно меньше информации. Это конкретный навык, по сути базовый человеческий социальный здравый смысл.

Но большинство компаний, которые занимаются только кодирующими агентами, не обучили эту способность в своих моделях. Мы можем это сделать, потому что мы делаем полный стек — мы не берём существующую модель у кого-то другого и не накладываем на неё фреймворк; мы обучаем всю модель с нуля, специально для этих способностей.

Модель, безусловно, нуждается в широком общем интеллекте, но у неё также есть эти специфические способности. И поверх этого вы строите всего ассистента и все детали вокруг него: память, среду выполнения и способ его «сердцебиения» — он периодически просыпается и проверяет: «Хорошо, вот цели, которые я о тебе знаю, есть ли что-то, что я могу продвинуть прямо сейчас?»

У нас также есть отдельная команда, которая занимается исключительно оттачиванием анимационных эффектов аватара в реальном времени, потому что это не просто аватар по умолчанию — вы можете настроить любой аватар, и тогда он движется естественно, и эффект фантастический. Мы также запускаем голосовой режим, где вы можете вести голосовые разговоры в реальном времени, и ваш ассистент всегда рядом с вами. Эти детали, я думаю, все проистекают из того, что мы делаем полный стек — модель и продукт разрабатываются вместе.

Ведущий: Ещё одна важная вещь — это виртуальная машина. Можете объяснить, почему она важна и что она открывает?

Почему Meta даёт каждому ИИ-ассистенту собственный компьютер?

Марк: По сути, чтобы агент мог делать что-то для вас, ему нужно место для хранения вашей информации. Мы считаем, что эта информация не должна смешиваться с информацией всех остальных в общем пуле ресурсов.

Подумайте об этом так: ваш ассистент будет знать много конфиденциальной информации о вас. Многие люди изначально сталкиваются с агентами вроде OpenCloud, устанавливая Mac Mini дома. Поэтому мы подумали: многие не хотят покупать Mac Mini или настраивать его самостоятельно. Так какой опыт лучше всего приблизит этот эффект? Ответ: вы просто скачиваете приложение, регистрируетесь и получаете компьютер, выделенный только для вас, чтобы ваш ассистент работал и хранил данные, и вокруг этого строится модель безопасности. Это приближает наличие собственного компьютера под вашим столом — даже мы в Meta не можем получить к нему доступ.

Например, конфиденциальные виртуальные машины Muse — это функция, которую мы разрабатываем, и даже мы сами не можем видеть содержимое внутри вашей виртуальной машины.

Мы также построили много всего вокруг этого, например, безопасное хранение учётных данных — когда вашему ассистенту нужно обработать информацию вроде паролей, он сам не должен иметь возможности видеть эти пароли; ему нужно лишь уметь «вставить» учётные данные, когда вы просите его войти в определённый сервис, и делать это только тогда, когда вы явно об этом просите. Система должна быть спроектирована именно так: эта информация сама по себе не должна быть свободно доступной, потому что несчастные случаи всегда происходят, кто-то может попытаться взломать систему, или в системе могут возникнуть проблемы.

Поэтому вам нужно гарантировать, что агент не может получить доступ к этим данным, и Meta тоже не может. Предоставление каждому ассистенту независимого компьютера и максимально экстремальная безопасность — это фундаментальная основа этой технологии: она и даёт Muse возможности, необходимые для помощи пользователям в достижении их целей, и обеспечивает конфиденциальность и безопасность, делая его продуктом мирового класса, лидирующим в отрасли в этой области.

Ведущий: Значит ли это, что, как и в WhatsApp, данные на виртуальной машине, к которой подключается Muse, зашифрованы? Как людям следует понимать, как на самом деле хранятся данные в виртуальной машине?

Марк: Мы по сути создали две версии. Muse Secure VM включает в себя различные функции конфиденциальности, в том числе всю архитектуру агента Sentinel, которую мы построили. У вас есть обычный ассистент Muse, который выполняет задачи для вас, и в то же время есть также агент безопасности, которого мы называем Sentinel, специально отслеживающий поток данных, входящих и исходящих из вашего Muse.

Если внешний контент попытается нарушить безопасность, Sentinel напрямую отсечёт его и не позволит этому случиться. Если он посчитает, что ваш Muse собирается совершить действие, требующее вашего вмешательства, он переопределит работу Muse и запустит оповещение для подтверждения разрешения человеком — например, «Хотите ли вы, чтобы Muse мог это делать?»

Вся эта система, плюс безопасное хранение учётных данных, плюс несколько уровней эшелонированной защиты, вместе составляют Muse Secure VM.

Мы также разрабатываем другой проект. Мы с Нэтом специально привлекли Мокси Марлинспайка — того самого человека, который вместе с нами тогда реализовал сквозное шифрование в WhatsApp — для разработки Muse Confidential VM. Основная идея в том, что поверх безопасной виртуальной машины вам также предоставляется выделенный ключ шифрования, так что даже Meta не может получить доступ к содержимому внутри.

Эту версию сложнее реализовать, потому что если Meta не может получить доступ к внутренней части виртуальной машины, отладка и обеспечение правильной работы системы становятся намного труднее. Поэтому мы потратили на это некоторое время, но она будет запущена в ближайшее время. Это по сути достигнет стандарта безопасности, который люди уже знают по WhatsApp и другим нашим самым защищённым продуктам.

Ведущий: Преимущество этого заключается только в том, чтобы люди психологически чувствовали себя в большей безопасности, или есть реальные выгоды?

Марк: Я думаю, что безопасность сама по себе важна. Наша цель — приблизиться к тому, чтобы дать вам локальную машину под вашим столом. Что даёт вам эта локальная машина? Она означает, что никакая компания не может получить к ней доступ.

Итак, предположим, Meta хочет предоставить вам этот сервис, как мы можем дать вам тот же уровень гарантий конфиденциальности и безопасности, чтобы никакая компания — будь то Meta, или кто-либо пытающийся взломать нас, или в некоторых странах, где вы не доверяете местному правительству — не могла получить доступ? Потому что мы сами тоже не можем войти, потому что у нас нет доступа.

Я думаю, это очень важно, и это также важная причина, по которой люди доверяют WhatsApp. Это реальная ценность для конфиденциальности, безопасности и доверия.

Если у вас будет ассистент, который знает о вас всё — я полагаю, почти у всех нас будет такой ассистент — забегая на 5 лет вперёд, у каждого будет ассистент, который глубоко понимает ваши цели и всё остальное и может помочь вам добиваться результатов. В такой ситуации быть лидером отрасли в области конфиденциальности и безопасности очень важно. Мы хотели сделать это с самого начала.

Как формировать личность ИИ?

Ведущий: Есть ещё одна очень интересная вещь — вы изучали психологию в университете.

Марк: Ну, я был там совсем недолго, два года, но я чувствую, что это повлияло на многие вещи, которые я позже создал.

Ведущий: Когда мы смотрим на модели, мы часто говорим, что какая-то модель «очень умная». Но так же, как мы выбираем друзей, это, конечно, потому что они умны, а также потому что нам нравится их энергия и то, как мы общаемся. Как вы думаете о формировании личности модели?

Марк: Я думаю, идеальная модель должна быть достаточно адаптируемой, чтобы соответствовать стилям разных людей. Я думаю, многие в индустрии ошибаются в этом — многие другие лаборатории сосредоточены на том, «как правильно спроектировать личность», но я никогда не считал, что личность — это что-то фиксированное. Это одна из причин, почему я так сильно верю в открытый исходный код, так сильно верю, что люди могут настраивать, и именно поэтому мы разработали Muse как высоко персонализированный продукт.

Вы можете настраивать и персонализировать Muse — не только внешний вид и голос. Когда вы впервые регистрируетесь, первое, что он спрашивает: «какой вы хотите, чтобы была моя базовая личность», и вы можете изменить это в любое время.

Мы стремимся сделать модель высоко управляемой, чтобы вы могли определить желаемый тип взаимодействия. Это важная часть того, чтобы сделать его отличным личным помощником — эта адаптируемость в отношении личности имеет решающее значение.

Ведущий: Какой стиль у вашего собственного Muse?

Марк: Я сделал его прямым и ориентированным на эффективность. Это довольно интересно. Ранние версии были очень саркастичными и юмористическими, но текущая версия более прямолинейна. Мой помощник использует внешний вид Muse по умолчанию, но я оделил его в тогу и дал ему глубокий, несколько комичный голос. Взаимодействовать с ним весело.

Ведущий: Я думаю, чтобы иметь чувство юмора, нужно быть действительно умным. Многие не понимают, что комики — одни из самых умных людей в обществе — быстрая реакция, достаточно остроумия. У вас определенно есть эта черта. Смотря все ваши интервью, вы всегда выступали хорошо.

Неожиданные предсказания Марка об ИИ и метавселенной

Ведущий: В вашем интервью с Тео вы много говорили о следующей границе технологий и о том, куда все это в конечном итоге ведет. Область ИИ пережила несколько «зим», когда люди думали, что прорывов не будет. Метавселенная также прошла через несколько таких периодов, когда все думали, что это невыполнимая ставка. Я вчера попробовал новую функцию голографического аватара, это очень круто. В интервью с Лексом казалось, что для записи вашего лица потребуется 11 часов, теперь это занимает всего 3 минуты. Как это продвинулось до сегодняшнего состояния?

Марк: В общем развитии метавселенной, когда мы основали Reality Labs, мы всегда верили, что в конечном итоге появятся обычные очки с нормальным внешним видом, и со временем они смогут как обеспечивать иммерсивное присутствие, так и стать отличными устройствами ИИ — потому что очки — единственная форма, позволяющая устройству видеть то, что видите вы, слышать то, что слышите вы, общаться с вами через ухо весь день и в конечном итоге отображать изображения.

Но 10–15 лет назад я предполагал, что мы сначала достигнем голографической технологии, а затем — высокоразвитого ИИ. Однако путь технологической эволюции интересен — мы на самом деле получили сначала ИИ и персональный сверхинтеллект, а уже потом технологию, позволяющую сделать голографическую технологию повсеместной и достаточно доступной. Этого я не предвидел, но я рад, что мы работаем в обоих направлениях.

Наши значительные инвестиции в очки поставили нас в очень выгодное положение, когда ИИ-ассистенты будут готовы. Многие из анонсов на Connect были именно о том, чтобы привнести Muse и множество функций ИИ в очки, и я думаю, пользователям это действительно понравится. Это большое дело.

Что касается присутствия, мы всё ещё продвигаемся, но прогресс относительно медленнее, потому что большая часть нашей энергии переключилась на создание Muse и функций ИИ для очков. Однако у нас есть давний проект по аватарам в реальном времени с высокой точностью.

Как вы сказали, три-четыре года назад вам нужна была целая комната для сканирования, чтобы записать человека со всех сторон, а затем вам нужны были графические процессоры корпоративного класса для рендеринга, что было очень громоздко. Демонстрация, которую мы сделали для подкаста Lex, была именно такой установкой. Теперь мы в основном заставили это работать в паре VR-очков — это первая форма очков, способная обеспечить такой потрясающий VR-опыт, а не большой шлем. Всего несколько фотографий могут создать ваш аватар, и прогресс поразителен.

Ведущий: И это также может управлять выражениями лица на основе голоса. В демонстрации это заставило меня смеяться, взаимодействовать, а затем поняло, как моё лицо движется вместе со звуковой дорожкой. Вы упомянули в том подкасте, что некоторые люди, обычно более сдержанные в своих выражениях, на самом деле хотят более богатых выражений в виртуальном мире. Как вы смотрите на то, что люди различают своё «виртуальное я» и «реальное я»?

Марк: Я думаю, мы всё ещё очень рано понимаем социологию и психологию этого. Я думаю, восприятие людьми себя и образ, который они хотят проецировать, часто несколько отличаются от того, кем они являются на самом деле. С момента рождения социальных сетей люди тщательно подбирали аватары. С аватарами Muse мы наблюдаем похожее явление. Это не столько «курирование» себя, сколько «курирование» «человека», с которым вы хотите общаться.

Я думаю, когда вы предоставляете людям возможность выражать себя, вы хотите, чтобы это действительно передавало их, и в то же время это само по себе является формой выражения, а не просто чистым зеркальным отражением — это одновременно и общение, и выражение. Мы надеемся создать нечто, что балансирует и то, и другое. Это всегда итеративный цикл: посмотреть, как люди используют это, затем улучшить. После многих лет работы мы теперь действительно на стартовой линии — впервые мы можем по-настоящему поместить довольно качественные реалистичные аватары в продукты, доступные на телефонах и в VR. Я очень рад увидеть результаты.

Как будет выглядеть 2030 год?

Ведущий: Хорошо, проведите меня через ваши размышления, перенеситесь в 2030 год: если всё пойдёт хорошо, как будет выглядеть сторона голографической технологии? Голограммы плюс Muse, плюс очки — как они все объединятся?

Марк: Моё понимание видения метавселенной всегда заключалось в эффективном слиянии физического мира с цифровым миром. Основная идея такова: у нас есть этот прекрасный физический мир, и в то же время у нас есть и прекрасный цифровой мир — огромное количество контента, накопленного в интернете за 20–30 лет, которое захватывает дух. Но способ, которым мы получаем к нему доступ, — это либо сидя за столом, либо через маленький экран в кармане, что по сути очень ограничено.

Я думаю, самая идеальная версия этого — бесшовное слияние физического и цифрового миров. Представьте так: прямо сейчас мы оба здесь. В некоторой будущей версии один из нас может быть голографической проекцией, но вы всё равно ощущаете чувство реального присутствия друг друга, что совершенно отличается от видеозвонка.

И суть виртуальной реальности как раз в том, чтобы передать это чувство присутствия — заставить вас действительно почувствовать, что вы находитесь в одной комнате с другими, или в другом месте. Вы можете достичь этого с помощью голографической технологии и смешивать это различными способами. Например, я могу сыграть партию в покер с друзьями, некоторые из которых присутствуют, а другие присоединяются через голографические аватары, и они тоже могут играть в карты, и сам карточный стол также может быть голографическим, так что те, кто не присутствует, тоже могут быть интегрированы в это.

В то же время ИИ также можно придать физическую форму и сделать так, чтобы он появился в этой сцене. В рабочих сценариях это имеет большой смысл — я уже постоянно использую различных агентов для программирования, чтобы создавать вещи. Представьте: у вас есть канал группового чата с несколькими людьми и несколькими агентами, и вы даёте агентам задания. Но иногда все собираются на встречу, и агентам, возможно, тоже следует присутствовать. Как они появляются? Просто добавьте несколько мест на диване, и они появляются в виде голографических аватаров. Или используйте того милого маленького персонажа Muse, или дракона, или любой странный и причудливый образ, который вы создадите.

Полагаю, в будущем это будет ощущаться вполне естественно.

Ведущий: Интересно. В ваших предыдущих интервью вы говорили, что технологическая индустрия часто забывает о «веселье». Я думаю, появление там физического ассистента также сделало бы это более реальным — как будто работа действительно передаётся на аутсорсинг. Когда вы видите, как Muse печатает, вы чувствуете, что что-то действительно происходит. Это сделано очень хорошо — возможность видеть, что происходит в браузере. Так как вы думаете, возможен ли такой сценарий: вы надеваете очки, а затем управляете своим компьютером, позволяя Muse делать что-то для вас на компьютере?

Марк: О, определённо. VR уже может это делать. Вы можете просто найти место, чтобы сесть, кафе подойдёт, а затем открыть свою рабочую станцию с шестью мониторами, писать на них код, всё там есть.

Что касается очков, самая популярная на данный момент модель не имеет дисплея, что, с одной стороны, делает их более доступными и позволяет большему числу людей использовать их, а с другой стороны, мы всё ещё работаем над тем, чтобы встроить дисплей в максимально компактную форму. Но мы уже выпустили версию Meta Ray-Ban с дисплеем, которая очень популярна, и это небольшой дисплей. Мы также выпустили прототипную версию полнообзорного голографического AR, которая, я думаю, будет очень захватывающей.

Так что вся линейка продуктов выглядит так: от чисто аудиоочков — без камеры, выглядящих как обычные очки, но с Muse внутри, позволяющих использовать различные аудиоинструменты, слушать музыку, совершать звонки — до более премиальных версий, все они существуют.

Ведущий: Мне интересно, с этими аудиоочками вы можете разговаривать с Muse, пока ваш домашний компьютер выполняет задачи?

Марк: Да, абсолютно. Мы только что выпустили эту функцию на конференции Connect.Теперь все очки подключены к Meta AI, что представляет собой «одноходовой» опыт — вы отправляете запрос, он отвечает, и на этом всё. Но с Muse мы, по сути, собираемся обновить все очки до Muse. Во-первых, вам больше не нужно говорить «Hey Meta», вы можете дать ему любое имя, что само по себе часть веселья. Затем вы просто говорите с ним напрямую, и он подключается к вашему Muse, а ваш Muse выполняет задачи в вашей защищённой виртуальной машине, помогая вам справляться с делами.

Ведущий: Это потрясающе!

Мышление основателя

Ведущий: Хорошо, сейчас мы здесь, Muse продвигается гладко, и очки тоже идут хорошо, но около года назад многие спрашивали: «что именно произошло с лабораторией сверхинтеллекта». В тот момент, что вы чувствовали внутри? Когда дела идут не очень, но вы всё ещё видите долгосрочное видение, что это за опыт?

Марк: Что действительно пошло не так — это проект Llama и Llama 4.

Llama 1 была довольно интересной моделью, она положила начало всему движению открытого исходного кода в ИИ, и мы этим очень гордимся. Llama 2 достигла масштаба, Llama 3 была хорошей моделью, почти на переднем крае в то время. Затем появилась Llama 4, и мы, по сути, отклонились от траектории, по которой должны были идти.

Всякий раз, когда что-то идёт не так, как я ожидаю, я трачу много времени на размышления: почему это произошло? Что нам нужно изменить, чтобы сделать лучше? На этот раз моё размышление было таким: я неправильно построил всю структуру команды.

Я смоделировал это так, как мы делаем работу по машинному обучению, например, ленту Instagram или рекламные системы — с сотнями или даже тысячами людей, работающих параллельно над множеством вещей. Но для создания языковых моделей вам действительно нужна чрезвычайно сплочённая небольшая команда, относящаяся к этому как к групповому научному проекту. Вам не нужно много людей, но это означает, что каждое место в команде чрезвычайно ценно.

Поэтому мы собрали лучших людей со всей Meta и одновременно привлекли множество блестящих людей со всей отрасли, сформировав совершенно новую команду — Meta Superintelligence Labs.

С моей точки зрения, когда MSL запустилась, я знал, что потребуется некоторое время, чтобы перезапуститься, перестроить инфраструктуру и обучить следующее поколение моделей. Но я знал, что мы собрали превосходную команду, и если команда сможет сплотиться и работать хорошо, результаты будут хорошими.

Для меня самый захватывающий момент, на самом деле был после выпуска Llama 4 — я думал, что мы на правильном пути, но оказалось, что нет. Это был довольно большой негативный сюрприз. Я думаю, как предприниматель, вы всегда проходите испытания в такие моменты, потому что неизбежно не всё будет идти гладко. И то, что действительно определяет траекторию: когда дела идут не так, как вы надеетесь, как вы находите путь вперёд.

Ведущий: Полагаю, верно и обратное — когда что-то намного превосходит ваши ожидания, как запуск Muse, как вы убеждаетесь, что можете воспользоваться этой возможностью?

Марк: Именно так. Теперь вся компания полностью вовлечена — сначала это была просто небольшая команда, создающая продукт, но теперь все понимают, что это действительно готово для большой сцены. Вся компания думает о том, как сделать эту вещь масштабной, как дать сотням миллионов людей испытать её.

От оптимизации всей инфраструктуры, чтобы всё работало гладко, и выжимания каждого бита вычислений из существующих GPU, до различных продуктовых команд, встраивающих Muse разными способами — например, в очки. Видеть, как все работают вместе, чтобы убедиться, что Muse может масштабироваться плавно, — это замечательное чувство.

Как Марк пишет и доносит видение

Ведущий: Как основатель, я чувствую, что это тот момент, которого ты жаждешь больше всего — когда всё складывается вместе. Как ты доносишь видение до компании? Поскольку так много вещей продвигается одновременно, я чувствую, что ты много пишешь. Каков твой процесс?

Марк: Письмо очень помогает мне, как в уточнении собственных мыслей, так и в общении с внешним миром. Этим летом я написал очень длинный текст под названием «Будущее принадлежит всем», около 15 страниц, который помог мне систематически