扎克伯格谈Muse:三大赌注完成交汇
Muse上线两周用户即达数百万,扎克伯格直言“一出手就是全垒打”。这款个人AI Agent即将全面接入Ray-Ban智能眼镜,元宇宙、智能眼镜与大模型三条押注,正在加速汇流。此外,他罕见坦承Llama 4失败是“最可怕的时刻”,并透露Meta正在建设5吉瓦级算力集群。
三年前,Meta CEO扎克伯格在Joe Rogan节目上说过,有一天人们戴上眼镜、AI Agent就会随之出现。如今,这一幕或正在发生。
Meta推出的个人AI Agent——Muse上线两周用户即达数百万。扎克伯格在9月25日一档访谈节目中表示:“每隔几年我们才能遇到这种情况。”他将Muse的早期反响定性为“一出手就是全垒打”——这在Meta产品历史上属于少数。
与此同时,他宣布Muse将整合至全线Ray-Ban智能眼镜,用户无需再说“嘿Meta”,而是可以自定义唤醒词直接呼叫自己的个人AI Agent。
多年来被外界视为三场独立豪赌的元宇宙、智能眼镜和大模型,正在Meta内部产品层面加速合流。
在这场访谈中,扎克伯格还坦承了Llama 4失败是“最可怕的时刻”,并透露Meta正在建设5吉瓦级训练集群,认为足够大的算力可“暴力破解”AGI。
Muse为何能“一出手就是全垒打”
Muse的起点,是扎克伯格和团队成员Nat与Alex坐在一起,用开源工具在家里“拼凑”出一个早期版本。
“我们意识到,这是一种神奇的体验,”扎克伯格说,“如果我们能把它做成任何人都可以用——不需要自己买Mac Mini、不需要在终端里折腾——那么这将是数十亿人想用的东西。”
这句判断,驱动了此后整套研发逻辑:不只是训练模型,而是从模型、脚手架、到Agent的“心跳”机制全栈自研——Agent会定期自动唤醒,检查用户目标,主动推进待办事项。
上线后的数据印证了这一判断。两周,数百万用户。
个人AI:重点是执行、记忆与“判断力”
对于个人AI与通用AI的差别,扎克伯格将当前竞争焦点概括为让模型成为更好的Agent。
“过去一年最大的事情,基本上就是编程Agent。”他说,编程能力很重要,因为即使用户没有直接写代码,“你的Muse也会在后台一直为你写代码,去完成各种事情”。
但他认为,个人Agent不能只具备编码或任务执行能力,还需要理解隐私边界和社交语境。
扎克伯格举例称,用户让Muse预订餐厅时,Agent可能知道用户存在过敏情况或怀孕等信息,但并不意味着这些信息应该被自动披露。“你会希望它完成任务,同时尽可能少地披露信息。”
他称,这种能力属于人类通常具备的“基本社交技能或常识”,但如果只是训练编码Agent,许多公司并未将其纳入模型能力范围。
“我们训练的是整个模型,而不是拿别人的现成模型,再在外面搭一个框架和Agent。”扎克伯格说。Meta还在产品层面加入记忆、任务追踪、虚拟角色动画和实时语音互动等功能。
在个性化方面,他表示,Meta并不认为AI应该只有一种固定人格。“很多实验室都在关注怎样把人格调到正确状态,但我从来不认为人格只有一个正确答案。”
他称,Muse允许用户修改头像、声音和基础性格,模型设计目标是具备较高的可操控性。“你可以定义自己希望如何与它互动,这对个人Agent很重要。”
每个Agent都有自己的“电脑”
Muse区别于其他AI产品的核心基础设施之一,是Meta为每个Agent单独配备了一台安全虚拟机(Secure VM)。
扎克伯格解释了为什么这是必要的:
你的Agent会了解你很多敏感信息。我们不认为这些信息应该跟所有人的数据混在一个池子里。
他把Muse Secure VM比喻为“放在你桌子底下的那台只属于你的电脑”——用户数据加密存储,密码等敏感凭证通过独立安全模块管理,Agent本身无法直接读取。
在此基础上,Meta还设计了“Sentinel”安全Agent,专门监控进出Muse的数据流,一旦检测到异常或高风险操作,会直接拦截并提示用户授权。
元宇宙、智能眼镜与Agent,三条路线正在汇合
扎克伯格在访谈中透露,Muse将全面接入Ray-Ban系列智能眼镜,并对现有交互方式做出升级。
目前的眼镜是“单轮对话”体验——说一句,得一个回复,结束。接入Muse之后,眼镜变成Agent的前端入口:用户开口,后端Muse在安全虚拟机里持续工作,完成任务再反馈。
对于眼镜的产品路线,他描述了一条清晰的硬件梯队:
▪︎ 无摄像头的纯音频眼镜:已搭载Muse,可处理通话、音乐、语音任务
▪︎ 带小显示屏的Meta Ray-Ban:已发布,具备基础视觉反馈
▪︎ 全视场角全息AR原型:已发布,扎克伯格称“会非常令人兴奋”
他称,Meta在眼镜上的长期投入,使公司在AI Agent成熟后处于较有利的位置。Meta正在将Muse及更多AI功能引入眼镜产品,而过去相对更强调“临场感”的元宇宙技术仍在继续推进,只是当前更多资源转向了Muse和智能眼镜的AI功能。
对于虚拟形象,扎克伯格称,Meta此前需要通过房间级设备、多角度扫描以及企业级GPU环境,生成较高质量的写实化身;目前,用户通过少量照片即可完成设置,相关能力已可运行于一副VR眼镜中。
展望2030年,扎克伯格称,元宇宙的核心愿景始终是融合物理世界和数字世界。他举例称,未来人们可以在线下与通过全息影像接入的朋友共同参与活动;在工作场景中,人类与多个Agent也可以共同参与群聊或会议,Agent可以以全息形象或其他具身化形式出现。
“最可怕的时刻”:Llama 4的失误
并非所有押注都一帆风顺。扎克伯格在访谈中罕见地直接谈及了Llama 4的失败。
Llama 4之后,那是最可怕的时刻……我以为我们在正轨上,但我们没有。这是一个相当大的负面意外。
他把问题归结为团队结构的根本性错误:
我按照Instagram推荐系统或广告系统那种方式来组建团队——几百上千人并行推进。但训练语言模型需要的是一支紧密协作的小团队,把它当作一个群体科学项目来做。每个席位都极为宝贵。
由此,Meta彻底重组,从业内广泛引入顶尖人才,成立Meta超级智能实验室(Meta Super Intelligence Lab,MSL)。扎克伯格表示,新一代模型即将发布,但不会在Connect大会上公布。
算力路线:暴力破解AGI,5吉瓦项目在建
谈及通往AGI的技术路径,扎克伯格给出了一个直接的判断。
我不确定还需要什么根本性的架构突破……我认为我们已经大致知道配方了。如果你能建造一个足够大的超级计算机集群,就可以暴力破解,到达那里。
目前Meta的算力扩张路线:俄亥俄州超过1吉瓦的集群已基本投入使用,用于训练下一代模型;路易斯安那州5吉瓦级集群正在建设中。
他表示,“当你拥有多吉瓦集群进行训练时,你基本上就会得到某种接近AGI乃至超级智能的东西。”
不过他也补充,当前算力驱动路线并不意味着架构研究不重要——
人脑只消耗约10瓦,而我们的系统可能比它低效一百万倍。如果把大规模算力和架构突破结合起来,才能真正领先。
对齐,不是负担,是产品必须解决的问题
扎克伯格对AI安全的态度很务实——他不把它视为监管压力,而是产品能否成功的前提。
如果你让Muse做一件事,它却做了相反的事,谁还会用它?我们需要让模型不只是理解你的具体指令,还要理解你的意图和你的价值观。
“Muse要触达十亿用户,我们就必须解决对齐问题,或者说在这上面取得非常大的进展。”他说。
对于训练过程中的安全边界,他用了一个类比:“就像父母给孩子立规矩——如果它通过修改系统配置来'完成'一道编程题,我要告诉它:不,我让你去学解题方法,不是让你找捷径绕过去。”
访谈全文如下:
主持人: 这件事将会有数十亿人想要使用。对您来说,做建设是一种怎样的感受?"永生"是一种可能吗?好,如果您带我进入您的思维,快进到2030年,那会是什么样子?
这位是马克·扎克伯格。22年前,他构建了一个连接数十亿人、永远改变了世界的社交网络。而如今,他决定建造更宏大的事物。为此,他正在元宇宙、智能眼镜和人工智能领域大举押注。多年来,怀疑者认为这是三场各自独立、不可能成功的赌注,但他们忽略了更宏观的图景——因为当下,这些押注正在汇聚,共同创造出一种全新的超级智能。
今天,我们将向大家呈现这一切,我也将向马克提出一些他从未被问过的问题,倾听他对未来的愿景,让您能够提前布局,构建下一件大事。
主持人: 非常感谢您来到节目。
马克: 谢谢,很高兴来这里。
主持人: 为了这次对话,我把您做过的每一次采访都看了一遍。
马克: 好家伙,那比我自己看的还多。
主持人: 很好玩,收获颇丰。有两件事给我留下了深刻印象:第一,您对"建造"的热爱,我感觉您就是最顶尖的建造者之一;第二,您押注的能力——敢于做出巨大的赌注。我觉得这周,所有这些押注正在汇聚到一起,所以我们就从这里说起吧。
马克: 好的。这些事情我们已经做了很长时间了。AI方面,作为一家公司,我们几乎从创立之初就在做了——第一版新闻资讯流在某种程度上就是一个机器学习产品。然后我们大约在15年前创建了AI研究实验室。
但现在我们进入了新阶段——大约一年多前,我们启动了Meta超级智能实验室。这是一次相当彻底的研究重启,从整个行业引进了大量优秀人才,令人振奋。目前,我们看到模型越来越好,下一代模型即将发布,不过不是在Connect大会上宣布。此外,我们还有Muse个人助理,目前来看反响非常好。
在构建这些东西的时候,你其实并不确定结果如何。我们自己是喜欢的。早在今年年初,我就在家里用自己的方式把Open Claw拼凑起来,感受这个东西是怎么运作的,以及怎样才能把它打造成一种任何人都能使用的神奇体验。
基本上,当我们——我、Nat和Alex——坐在一起,意识到这是一种神奇的体验,并且如果能把它打造成一个开箱即用的版本,让那些不懂技术、不想去自己安装Mac Mini、不想进终端折腾、也不想在出问题时调试的普通人也能用的时候,我就觉得,这将会是数十亿人都想要使用的东西。
从那以后,我们一直在围绕这个目标努力:专门为它调优模型,不仅构建了助理本身和运行框架,还构建了为每个助理提供独立计算环境的技术——我们为此构建了整套Muse安全虚拟机。
我们内部一直觉得这很特别,内部人员也很喜欢,但你永远不知道产品发布后大家会怎么反应。偶尔会出现一鸣惊人、开门红的情况,但大多数时候你会收到一些正面反馈,还需要迭代几个地方才能真正让产品"咔哒"一声落地。而这一次,它一出来就直接"咔哒"了。看到这一切发生真的非常令人振奋——才两周,使用人数就已经有数百万,这相当罕见。每隔几年我们才能遇到这样的情况,但这绝对是创业公司最令人享受的时刻之一。
主持人: 您能坚持在赛场上、不断尝试,这让我非常佩服。而且这么多次都打出了安打,真的很厉害。您之前有一次和乔·罗根的访谈,大概是三年前,最后您提到有一天可以直接戴上眼镜,AI助理也会随之出现。所以我感觉Muse已经有实体化的形象,这一点非常聪明,因为那感觉是必然会发生的事。
马克: 我觉得这也只是让它显得更友好可爱。我认为太多人把AI描述得像个令人恐惧的东西,但AI应该只是有用又有趣的。那个实体化的形象——项目早期有位设计师做出了那个角色,不知为何他们一直想迭代,但第一版就是最好的。后来有人说,"哦,它得是蓝色的,因为是Meta嘛。"我说,"不,我觉得这个形象就是对的,你第一次就钉住了。"就这样,就是好玩。
个人AI与通用AI有何不同?
主持人: 很好的细节。如果您想让模型在个人事务方面表现得非常出色,而不仅仅是通用智能模型,那么训练方式会有什么不同?
马克: 我认为目前的核心在于让模型成为优秀的"智能体(agent)"。过去一年,最大的风口是编程智能体,其中蕴含两个核心思想:编程专业能力,以及成为优秀智能体的通用能力。
我们的策略是,将智能体本身做好放在首位,而不是专攻编程能力。
编程能力之所以重要,是因为即使用户自己不认为在写代码,Muse也在后台一直为你写代码来完成各种任务。但我们认为,智能体应该首先是一个出色的智能体,编程能力服务于此目标。
此外,在构建个人助理时,有些事情比构建企业软件产品更为重要。比如,如果你在构建一个企业编程工具,模型根本不需要有任何关于"信息披露尺度"的概念——比如什么信息该说、什么不该说。但对于Muse来说,这非常重要。
你需要把这种能力训练进模型里,就像训练其他任何能力一样。你会告诉它很多事情,然后希望它去帮你实现目标。比如,你想让它帮你订餐厅,你在找一家合适的餐厅,但你可能有某种过敏症,或者你怀孕了,而你可能不想把这些透露给餐厅。但Muse会知道这些信息,你希望它在尽量少透露信息的同时完成任务。这是一种具体的技能,本质上是人类的基本社交常识。
但那些只做编程智能体的公司,大多数都没有把这种能力训练进去。我们之所以能做到,是因为我们在做全栈——我们不是从别人那里拿来一个现成的模型再套个框架,我们是从头训练整个模型,专门为这些能力服务。
模型当然需要具备广泛的通用智能,但它同时也具备这些特定能力。然后在此基础上,你构建整个助理,以及它周围所有的细节:记忆、运行框架,还有它"心跳"的方式——它定期唤醒,检查一下"好,这些是我了解的关于你的目标,有什么我现在可以推进的吗"。
我们还有一个专门的团队,只负责打磨虚拟形象的实时动画效果,因为不仅仅是默认形象——你可以自定义任何形象,然后它就自然地动起来,效果非常棒。我们还在推出语音模式,你可以进行实时语音对话,你的助理就在那里陪着你。这些细节,我觉得都源于我们在做全栈——模型和产品是一起开发的。
主持人: 另一件大事是虚拟机。能解释一下它为什么重要,以及它解锁了什么吗?
为什么Meta要为每个AI助理配备独立计算机?
马克: 基本上,一个智能体要能替你做事,就需要一个地方来存储你的信息。我们认为这些信息不应该和其他所有人的信息混在一个资源池里。
可以这样理解:你的助理会知道很多关于你的敏感信息。很多人最初接触OpenCloud这类智能体时,会在家里自己配一台Mac Mini。于是我们想,很多人并不想买Mac Mini或者自己设置。那么,什么样的体验能最好地近似这种效果呢?答案是:你只需下载一个App、注册,就能获得一台专属于你的计算机,供你的助理工作、存储数据,并围绕此建立安全模型。这样就近似于在你桌下有一台自己的电脑——就连我们Meta也无法访问。
比如Muse机密虚拟机,这是我们正在开发的功能,就连我们自己也无法看到你虚拟机里的内容。
我们还围绕这些构建了很多东西,比如安全凭证存储——当你的助理需要处理密码之类的信息时,它本身不需要能看到这些密码,只需要在你要求它登录某个服务时能"插入"凭证,并且只在你明确要求时才这样做。系统应该这样设计:那些信息本身就不可随意访问,因为意外总会发生,有人可能试图入侵,或者系统可能出现问题。
所以你要确保智能体无法访问这些数据,Meta也无法访问。为每个助理提供独立计算机,并把安全性做到极致,是这项技术的根本基础——既赋予Muse帮助用户实现目标所需的能力,也保证了隐私和安全,使其成为该领域世界级、行业领先的产品。
主持人: 那这是否意味着,就像WhatsApp一样,Muse连接到的虚拟机上的数据是加密的?人们该如何理解数据在虚拟机中的实际存储方式?
马克: 我们基本上构建了两个版本。Muse安全虚拟机(Secure VM)包含各种隐私功能,其中包括我们构建的整套Sentinel智能体架构。你有一个正在为你执行任务的普通Muse助理,同时还有一个我们称为Sentinel的安全智能体,专门监控进出你的Muse的数据流。
如果有外部内容试图破坏安全,Sentinel会直接切断,阻止其发生。如果它认为你的Muse即将采取某个需要你介入的行动,它会覆盖Muse的操作,并触发提醒,让人来确认权限——比如"你希望Muse能做这件事吗?"


