GPT-6 Astra 发布那天晚上,我蹲完发布会已经快凌晨两点了。屏幕关掉之后,我没睡着,手机里ZHO的动态已经被转到我首页:四个字,“挺卑微的”。底下评论吵成一团,有人说他矫情,有人附和说看完首发内测demo确实睡不着。
我属于后者。我做AI创意工具做了几年,自认对新模型的迭代已经脱敏了。GPT-4出来的时候我兴奋,GPT-4o出来的时候我觉得方便,但GPT-6 Astra这次给我的感觉完全不同——像是工位上忽然多了一个有眼睛、有手、有耐心的同事,而我还没有想好怎么和他分工。这篇文章不打算写成新闻复述,我想认真聊聊这次发布背后的能力边界、首批内测的真实反馈、那个绕不开的“贵”字,以及我们这些在AI浪潮里讨生活的人,怎么理解这种“卑微感”。
1. 一场让人辗转反侧的发布:GPT-6 Astra到底是个什么东西
1.1 它不是又一个聊天机器人,而是一套“眼睛+大脑+手”的闭环
先解决一个基础问题:GPT-6和Astra是什么关系。GPT-6是新一代大模型本身,Astra则是OpenAI把这套模型塞进摄像头、麦克风、传感器之后形成的“物理世界交互层”。换句话说,GPT-6是大脑,Astra是眼睛和手。发布会上最震撼的场景不是文字问答,而是Astra Pro拿着手机在房间里走动,实时辨认物体、测量距离、理解空间关系,然后基于这些信息跟你对话。
这和我们之前认识的AI完全不是一个物种。以前的聊天机器人是“你输入文字,它输出文字”,偶尔能看张图,但本质上是个超级文本处理引擎。GPT-6 Astra的输入是连续的视频流、深度传感器数据和语音指令,输出是行动建议甚至直接执行的任务。它不是一个对话框,而是一个能感知环境的数字生命体。ZHO说“挺卑微”,很大程度上就是因为这种“物种差异”太过明显。
1.2 从“读文字”到“读世界”,跨过的不是半步
很多人低估了“读世界”和“读文字”之间的鸿沟。文字是已经被人类整理过的符号系统,模型只要学会符号之间的关系就能显得很聪明。但摄像头点云、深度信息、实时视频流这些原始数据,没有标点符号,没有段落结构,全是一堆坐标和颜色信号。让AI从这些信息里识别出“这是一把椅子”“那堵墙离你三米远”,需要的是完全不同层级的理解能力。
打个比方,过去的AI像一本会自动更新的大脑百科全书,你问什么它答什么。GPT-6 Astra则像坐在你副驾上的老司机,它看你打方向盘、看前方路况、看后视镜,然后给出的是基于整个环境态势的判断。GPS告诉你“前方三百米右转”,副驾老司机会说“这条道有点堵,建议下个路口掉头走小巷”。后者这种能力,靠纯文本训练是训不出来的,必须有对三维世界的实时建模。这也是为什么“摄像头点云”会成为这次发布的核心热词之一。
1.3 “能干活”也“看得住”:人类给AI的期望和最后的护栏
发布会上反复强调一句话:GPT-6 Astra“能干活”,也“看得住”。这话听起来像宣传语,但里面的信息量挺大。“能干活”意味着它可以自主完成长任务——不是回答一个问题就结束,而是设定目标、拆解步骤、调用工具、检查结果,一路把事情办完。“看得住”则是可控性的承诺:你能随时打断它、纠正它、看到它在做什么、知道它下一步打算做什么。
对普通用户来说,“能干活”很重要,但对真正敢把工作交给AI的人来说,“看得住”才是底线。我见过太多人在GPT-4时代做个稍微复杂点的任务就要守在屏幕前不断纠偏,生怕模型跑偏还不自知。GPT-6 Astra如果真能像发布时演示的那样,一边干活一边汇报、遇到不确定的地方主动停下来问人,那么我们才第一次可以把重要的事真正托付出去。坦白讲,光是这个“托付感”的变化,就已经足够让我后半夜失眠了。
2. “能干活”的上限:五道数学题和连续几十小时的马拉松
2.1 数学难题背后的推演能力意味着什么
这次首批内测里流传最广的传闻是“GPT-6一天攻破5道数学难题”。数学这个东西特别诚实,它没有任何捷径。你可以在语言翻译、文案写作里用“看起来像那么回事”糊弄过去,但数学推导错一步就是错一步。GPT-6能连续几个小时、几十步推理,最终解决高难度数学题,说明它的长链条逻辑能力已经有了质变。
过去的大模型做数学题,经常是“看起来在推理,其实在背题”。你稍微变换一下说法,它可能就掉坑里了。而根据内测用户的描述,GPT-6遇到复杂问题时会自己拆解子目标,每一步验证一下,发现矛盾就回溯重来。这个流程听起来就像是人类数学家的解题方式。这意味着它不再靠“猜下一个词”硬撑,而是具备了一定的结构性推理能力。对科研工作者来说,这可能是比聊天、写作、画图都更重要的突破。
2.2 真正的变化是“连续干活”:从多轮对话到项目制执行
数学难题只是表象,GPT-6 Astra最让我震惊的变化是它能“连续干活”了。以前我们说的多轮对话,本质上是模型被动响应:你问一句,它答一句,上下文窗口大了点而已。可GPT-6 Astra给人的感觉不一样,它更像一个项目经理。你给它目标,它自己拆任务、排优先级、调工具、做中间检查,最后给你交付结果。
我举个例子。有内测用户让它做一个细分行业的调研报告,包括市场规模、头部玩家、产品对比、潜在机会。放在以前,这需要用户自己把任务切成十几次对话,还要不断给AI补充信息、修正方向。而GPT-6 Astra的做法是:先列调研提纲,然后自己搜索资料、筛选可信源、画对比表格、写结论摘要,过程中偶尔跳出来问一句“这个数据源有点旧,需要换吗”,等你确认后继续往下跑。这种“项目制”的工作方式,才是真正意义上的生产力跃升。它可以连续运行几十个小时不吃不睡,这就是“马拉松”的来历。
2.3 首批内测用户都在测什么:我看到的几类真实反馈
我把网上能翻到的首批内测反馈大致分成了几类。程序员群体最直接,有人让它重构一个堆满历史包袱的老模块,原来的估算是三天,GPT-6 Astra自己读完代码、改了十几个文件、写完了测试用例,中间遇到两次报错,居然自己定位修复了。研究者群体主要用它在文献综述和实验设计上,有人评价“以前让AI写综述像拼贴画,现在像在做真正的学术梳理,引文和逻辑都能对上”。
创作者群体的反馈最五味杂陈。有人让它生成完整的分镜脚本配乐Demo,出来的东西不再是零碎的“灵感碎片”,而是一个接近成品的方案。还有普通用户让它做旅行规划、整理照片、扫描房间布置家具,离谱的不是它都会做,而是它会“多做一步”——比如整理完照片之后主动帮你按时间线生成了一个家庭回忆影集。这种“多做一步”的主动性,恰恰是过去AI产品最欠缺的。首批内测结果用“离谱”来形容,确实不算夸张,是好得出乎意料。
3. Astra Pro的摄像头点云:AI第一次用眼睛理解你所在的房间
3.1 点云不是噱头,它是物理世界的一张“数字图纸”
先说清楚“点云”到底是个什么东西,因为我发现很多人把它当玄学概念。其实点云就是把现实世界的三维坐标用几百万个点记录下来,相当于给物理世界描了一张数字图纸。你拿起Astra Pro对着房间扫一圈,墙上每一条纹理、桌沿每一道弧线、沙发和电视之间的距离,都会变成三维空间里密密麻麻的点。AI看到的不是平面图像,而是一个可以量测、可以导航、可以推理的立体沙盘。
这种能力直接改变了一个核心问题:AI对物理空间的理解从“猜”变成了“测”。以前你问AI“我这个房间能放得下一张两米的书桌吗”,它只能根据你口头描述瞎猜。现在Astra Pro扫一眼点云,它可以直接告诉你房间的长宽高、门和窗户的位置、剩余墙面面积。它不再是凭借文字想象的家伙,而是一个真正“见过”你家房间的人。这种差异,就像你让一个盲人朋友帮你找钥匙,和让一个视力正常的朋友帮你找钥匙之间的区别。
3.2 “看见”之后是“配合”:从认识房间到替你跑腿
摄像头点云更大的价值在于“看见”之后的配合能力。有了三维空间模型,Astra Pro能做的就不只是回答问题,而是给出可执行的行动方案。比如你问它“我钥匙放哪了”,它可以回看之前扫描时记录的画面,告诉你“在门口鞋柜第二层,靠左”。你问它“想在客厅加一个投影仪幕布,挂哪面墙合适”,它会结合空间尺寸和光线方向给你建议。
很多真实场景是过去的AI完全无能为力的:家庭服务机器人要知道房间布局才不会撞墙;AR导航需要理解现实中每一个物体离你的距离;安防系统需要判断一个移动的阴影到底是人还是窗帘摆动。所有这些场景的基础,都是三维点云。这也是为什么我说GPT-6 Astra不是“又聪明了一点”,而是“换了一条赛道”。它已经一只脚踏进了物理世界的操作系统。
3.3 为什么这个功能让人觉得“卑微”
聊到这里,我大概能解释ZHO那句话里最让人难受的部分了。以前的AI再强,也只是在你主动输入的时候才发挥作用。你问它“什么是存在主义”,它给你答得头头是道,但那和你没太大关系。而Astra Pro不一样,它拿着摄像头在房间里扫一遍,就已经记住了你家书架第三层摆着哪些书、沙发和茶几之间的过道有多宽、窗户朝哪个方向、傍晚几点阳光会打在桌面上。你每天生活在自己的房间里,却不一定能说清这些细节,但它知道。
这是一种很微妙的不适感:你突然发现自己并不是自己生活空间的完整观察者。AI用几秒钟完成的空间建模,比你住了几年的主观认知还要精确。ZHO那句“挺卑微”,我想说的是:当工具比你更懂你所在的环境、比你更擅长连续思考、比你更能保持专注时,你很难再理直气壮地觉得自己是“万物之灵”。但卑微之后怎么办,这才是重点。我们不是要跪着跟AI相处,而是要想清楚剩下的那些人类独有的东西到底是什么。
4. 首批内测结果与“贵”的问题:强是真的强,贵也是真的贵
4.1 首批内测“离谱”在哪:准确率、长任务成功率、多模态融合
从刚开始流出的首批内测信息来看,GPT-6 Astra最夸张的还不是单个能力,而是几个能力的融合。准确率方面,长文档理解、数学推理、代码生成的出错率都比前代明显低,尤其是那种“一本正经胡说八道”的幻觉情况少了很多。长任务成功率更是惊人,有内测用户反馈,一个需要上百步操作的数据分析任务,过去GPT-4跑不到一半就迷路,GPT-6 Astra不仅跑完了,还在中途自己发现了一个数据口径不一致的问题,主动停下来提醒用户确认。
多模态融合是另一个亮点。以前模型处理文字、图片、语音基本上是各干各的,Astra Pro则把摄像头画面、环境声音、用户指令整合到了一个统一的上下文里。比如它对你说“你身后书架上那本蓝色封面的书”,它能实时从视频流里定位那本书,甚至能根据你的视线方向判断你说的是哪一本。这种跨模态的实时协同,才是Astra Pro真正“离谱”的地方,因为它已经不是“多模态模型”,而是真正的“世界模型”雏形。
4.2 关于“GPT-6贵”的账要这样算
“贵”这个字在首批内测反馈里出现的频率,几乎和“离谱”一样高。有人算过账,跑一个深度调研任务,如果要让AI连续工作几个小时并调用各种工具,账单金额相当可观。我看到的一些截图,单次任务成本已经赶上过去一个月的订阅费。这里我不去引用具体数字,因为不同场景差异很大,但整体趋势很明显:能力越强的模型,使用成本越陡峭。
不过我想说,贵不贵,关键看对比对象。我把账算给朋友听:如果你把它当成一个随时在线的初级分析师,每天干8个小时活,不摸鱼、不请假、不需要社保和工位,那按任务量摊下来的成本,可能比雇一个实习生还划算。但如果你只是个偶尔问几个问题的个人用户,这个价格就显然不友好。整理一个示意表格,方便大家直观感受:
| 对比项 | 传统人工辅助 | GPT-6方案 |
|---|---|---|
| 时效性 | 按天或按周交付 | 按分钟或小时出结果 |
| 成本结构 | 固定月薪加招募管理成本 | 按任务量和计算时长计费 |
| 长任务处理 | 需要反复沟通和进度对齐 | 自主拆解,中途主动汇报 |
| 交付质量 | 依赖个人经验,波动大 | 稳定但需要人工把关 |
| 适用人群 | 企业和正式团队 | 高频使用、能算清ROI的专业用户 |
对普通人和独立创作者来说,这个门槛是真实的。不是说付不起这个钱,而是“值不值得付”很难判断。
4.3 谁在用,谁暂时用不起:新一轮数字壁垒
这引出一个让人不太舒服的话题:AI技术正在加速分化。大公司、研究机构、资金充足的初创团队,能第一时间用上GPT-6 Astra,把它嵌入到产品和工作流里,效率直接翻倍。而个人创作者、学生、小团队,可能要等到模型降价或开源版本出现才能用得起。这不是谁的错,但这是现实。
我身边已经有朋友的团队因为内测资格和算力成本问题,没法立刻把Astra Pro接入项目,眼睁睁看着同行发了几个惊艳的demo。这种落差真的很磨人。但我也提醒自己:模型总会降价,技术总会普及,真正拉开差距的,不是谁第一个用上最贵的模型,而是谁先积累了“用AI做事的正确方法”。等GPT-6白菜价的时候,没有方法论的人依然只会拿它聊天,有方法论的人却已经跑出了几十个项目的经验。所以,暂时用不起没关系,先把思维和流程练起来。
5. “挺卑微”之后,我给自己定了几条规矩
5.1 别和AI比“快”,要和它比“品味”
那晚失眠之后,我给自己做的第一件事,就是列了一条规矩:永远不要和AI比快、比知识量、比耐心,因为比不过,也不用比。AI可以一分钟生成一百个分镜方案,但它不知道哪一个最贴合你这部短片的情绪基调;AI可以给你十套房间设计效果图,但它不知道你每天下午坐在哪把椅子上看书最舒服。
品味、审美、价值观,这些听起来虚的东西,反而是人类创作者最坚固的护城河。AI的产出是“合理的平均值”,是海量数据里的最大公约数,它们往往工整、正确、但缺少那种“非你不可”的偏向性。而创作者的职责,就是从一百个“还不错”里挑出那个“就是它”的选择。这个选择背后的直觉和阅历,是数据训练不出来的。ZHO能在AI艺术圈里让人记住,恰恰是因为他有独特的取舍标准,而不是因为他每个作品都是AI生成的。
5.2 把它当成一个有超能力的“外聘同事”,而不是搜索引擎
从操作层面说,我调整了和AI协作的方式。以前我把大模型当搜索引擎用,现在我会把它当成一个“外聘同事”。既然是同事,就要学会派活、验收、让它自我批评。比如我让它出方案A之后,会再逼它扮演最挑剔的甲方,把方案A骂一顿,然后让它按照这些批评重新出方案B。这样一轮下来,得到的方案质量比我单方面提问要高得多。
另外,我开始建立个人评测集。每次用GPT-6 Astra处理完一个任务,我都会记录它哪里做得好、哪里理解偏了、哪个提问方式效果最好。时间长了,这就像是和AI之间的“工作默契手册”。别小看这件事,因为每个人使用AI的习惯不同,同一个模型在不同人手里的表现差异巨大。你越了解它的脾气,它越能发挥出真实水平。这个过程有点像一个老程序员逐渐摸透一个新的框架,踩坑、记录、总结,再踩坑、再总结。
5.3 普通人现在可以做的三件小事
最后分享三个我现在就推荐大家去做的小事,不需要等有钱买内测或顶配API也能开始。
第一,如果你手头有支持深度摄像头的设备,试着扫一遍自己常待的房间,让AI记住这个空间的布局。当它能指出“你书桌左边第二格抽屉”的时候,你会对“AI理解物理世界”这句话有真切的体感。没有设备也没关系,用手机拍一段完整视频,让支持多模态的AI描述一遍空间,也能找到感觉。
第二,挑一个你每周至少重复三次以上的任务,完整地交给AI跑一遍。不要只让它“给建议”,而是让它直接产出“结果”,比如整理周报、生成会议纪要、做竞品信息汇总。连续记录两周的成功率和失败点,你会知道哪些环节适合外包给AI,哪些必须自己把关。
第三,每天花五分钟记录两个问题:今天哪里觉得AI比我强?今天哪里觉得AI不如我?前一个问题帮你保持谦虚和学习欲,后一个问题帮你建立自信和判断力。这比单纯焦虑或盲目崇拜有用得多。
ZHO的“挺卑微”我记到现在。那不是一个创作者的自我否定,而是一种清醒的震撼——看见更强大的东西之后,人会本能地反思自己的位置。但我更相信,工具越强,人越要做回人。AI帮我们处理复杂、琐碎、需要耐心的部分,而我们负责提出真正有价值的问题、做出真正有审美的选择。卑微过后,该干活还得干活,只是干法,确实要变一变了。