刚刚,ChatGPT 和 Claude 同时大更新,不会给 AI 当老板的打工人要被淘汰_-Codex_OpenAI_Opus
- 人气:
就在刚刚,硅谷 AI 圈上演了一出「火星撞地球」。
OpenAI 和 Anthropic 像约好了一样,同时甩出了自家的重磅更新:Claude Opus 4.6 和 GPT-5.3-Codex。
如果说昨晚之前,我们还在讨论「怎么写好 Prompt 辅助工作」;那么今天凌晨,我们可能被迫要学会「如何作为老板去管理 AI 员工」。
AI 造 AI,顺便接管你的电脑
就在昨天,Sam Altman 刚在 X 平台上凡尔赛了一把 Codex 的「百万活跃用户」里程碑。短短一天后,OpenAI 再次乘胜追击,扔出王炸——GPT-5.3-Codex。
技术文档里藏着一句极具分量的话:「这是我们第一个在创造自己的过程中,发挥了关键作用的模型。」
说人话就是:AI 已经学会了自己写代码、自己找 Bug,甚至开始自己训练下一代的 AI 了。这种自我进化能力,也直接体现在了一连串跑分数据上。
还记得那个模拟人类操作电脑的 OSWorld-Verified 基准测试吗?前代模型只有 38.2% 的准确率,连及格线都够不上。
但这次,GPT-5.3-Codex 直接跳涨到了 64.7%!
要知道,人类的平均水平也就 72%。这意味着,AI 距离像你一样熟练地甩鼠标、切屏、操作软件,只剩下一层窗户纸的距离。
而在 Terminal-Bench 2.0(命令行操作)中,它更是拿下了 77.3% 的高分,把 GPT-5.2(62.2%)远远甩在身后。
知名 SWE-Bench Pro 基准测试覆盖四种编程语言,不仅抗污染,还全是真实世界的硬核工程难题。
GPT-5.3-Codex 在这里不仅拿下了 SOTA(最高水平),而且用的 Token 比以往任何模型都少。这意味着什么?意味着它不仅干活猛,解决问题的路径还比人类更短、更省钱。
OpenAI 甚至展示了它独立构建的能力:
在几天内,它从零构建了一款包含多张地图的赛车游戏 v2,顺手还搞定了一款管理氧气系统的深海潜水游戏。
最让我印象深刻的是 GPT-5.3-Codex 对模糊意图的理解。
在构建「Quiet KPI」落地页时,它自动把「年度***」换算成了「打折后的月付价格」,甚至还贴心地自动补充了用户评价轮播——这一切,都不需要你下指令。
OpenAI 的野心已经写在脸上了:以前微软常说 AI 将会成为人类的副驾驶(Copilot),但现在 AI 更想做那个能掌控方向盘、甚至能自己修车的司机。
对了,还有一个有趣的细节。
此前外界盛传 OpenAI 对英伟达的 AI 芯片颇有微词,但这次官方博客特地强调:GPT-5.3-Codex 的设计、训练和部署都在 NVIDIA GB200 NVL72 系统上完成。
这一波高情商的「感谢英伟达」,属实是给足了黄仁勋面子。
告别「金鱼记忆」Claude 迎来绝地反击
在 GPT-5.3-Codex 发布的前后脚,Anthropic 也端出了自己的春节大礼包。
坏消息是,大家期待的 Claude「中杯」Sonnet 模型没有更新;但好消息是,Anthropic 直接端出了「超大杯」—— Claude Opus 4.6。
相比于 OpenAI 在「行动力」上的激进,Anthropic 今天发布的 Claude Opus 4.6 则是在「思考力」和「可用性」上死磕。
很多企业用户都有一个名为 Context Rot(上下文腐蚀)的痛点:号称支持 200k 上下文,但塞进去的数据一多,AI 就开始顾头不顾尾。
这次,Claude Opus 4.6 拿出的数据简直是「降维打击」。
在 MRCR v2(长文本大海捞针)测试中,Claude Opus 4.6 的召回率高达 76%。
作为对比,上一代 Sonnet 4.5 只有惨不忍睹的 18.5%。从某种程度上说,这是一个从基本不可用到「高可靠」的质变。
这是 Claude Opus 4.6 首次引入了真正可用的 1M 上下文窗口。
这意味着什么?意味着你可以把几百页的财报、几十万字的代码库直接扔给它,它不仅能读完,还能精准地告诉你第 342 页脚注里的那个数字有问题。
更让打工人眼前一亮的是它的生产力功能。
一方面,Anthropic 这回直接把 Claude 塞进了 Excel 和 PowerPoint。它能根据 Excel 数据直接生成 PPT,不仅保留排版风格,连字体和模板都能对齐。在 Claude Cowork 协作环境中,它甚至能进行自主多任务处理。
另一方面,Anthropic 顺势在 Claude Code 中推出了实验性的 Agent Teams 功能,让普通开发者也能体验这种「指挥千军万马」的感觉:
- 角色分工:你可以指定一个 Claude Session 担任 Team Lead(组长),它不干脏活累活,专门负责拆解任务、分配工单、合并代码;其他的 Session 则是队友(Teammates),各自领任务去干。
- 独立作战:每个队友都有独立的上下文窗口(不用担心 Token 爆炸),它们甚至能背着你互相发消息(Inter-agent messaging),讨论技术细节,最后只把结果汇报给组长。
- 并行***:这东西有什么用?想象一下查一个顽固 Bug,你可以生成 5 个 Agent,分别验证 5 种不同的***设,像「***」一样并行排雷;或者在 Code Review 时,让一个队友扮「安全专家」查漏洞,一个扮「架构师」看性能,互不干扰。
为了展示 Opus 4.6 的极限,Anthropic 的研究员 Nicholas Carlini 搞了个疯狂的实验:Agent Teams(智能体团队)。
他没有亲自写代码,而是扔了 2 万美元 的 API 额度,让 16 个 Claude Opus 4.6 组成一个「全自动软件开发团队」。
结果在短短两周内,这群 AI 自主进行了 2000 多个编程会话,从零手写了一个 10 万行代码的 C 语言编译器(基于 Rust)。
这个 AI 写的编译器,还成功编译了 Linux 6.9 内核(涵盖 x86、ARM 和 RISC-V 架构),甚至跑通了 Doom 游戏。
虽然它还不够完美(比如生成的代码效率不如 GCC),但这个案例也表明我们不再是和 AI 一起编程,而是看着一个 AI 团队自主协作、查错、推进项目。
此外,它还学会了 Adaptive Thinking(自适应推理),能根据难度自己决定「想多久」。加上新增的「智能强度」控制,你可以在 Low 到 Max 四档之间切换。
定价方面,Anthropic 这次很良心,维持在每百万 Token $5/$25 的基础定价。看来是为了抢占企业级市场,铁了心要和 OpenAI 卷到底。
一个是激进天才,一个是靠谱老牛
知名 AI 评测人 Dan Shipper 在第一时间搞了个「盲测」(Vibe Check),他的评价非常精准:
Claude Opus 4.6 是「高上限,高方差」(High Ceiling, High Variance)。
它像是一个才华横溢但偶尔跳脱的天才。在测试中,它直接解决了一个让 iOS 团队卡了两个月的功能难题;在 LFG Benchmark 中拿到了 9.25/10 的高分。
但它偶尔也会「过度自信」,一本正经地胡说八道。如果你需要突破性的灵感,选它。
GPT-5.3-Codex 是「高可靠,低方差」(High Reliability, Low Variance)。
它像是一个经验丰富、绝不掉链子的资深工程师。推理速度提升 25%,几乎不犯低级错误,稳健得让人心安。
虽然在创造性任务上略逊一筹(LFG 得分 7.5/10),但在日常的 Coding 和运维任务中,它是最高效的老黄牛。如果你需要稳定交付,选它。
时间步入 2026 年,我们的角色开始发生变化。
在这个时间节点,对于普通用户而言,最大的变化莫过于此:Prompt Engineering(提示词工程)的重要性正在下降,而 Agent Management(智能体管理)的能力开始浮出水面。
当 ChatGPT 可以自主修 Bug 甚至操作你的终端,当 Claude 可以一次性吞吐 100 万字并精准定位细节时,我们不再需要像教小学生一样,把指令拆解得碎碎念。
我们需要做的,是学会如何以「管理者」的身份,去定义目标、审核结果、以及——决定在什么时候,把什么任务交给哪位「员工」。
这就是 2026 年的新职场:你的团队里混入了一群硅基天才,而你是唯一的碳基老板。返回搜狐,查看更多
- 2026-09-08撒金10亿,元宝就能弯道超车?_红包_微信_用户
- 2026-09-07第一批跟AI“互殴”的人快要上岸了_朱旭_工具_音乐
- 2026-09-08直播带货不香了?大佬带头卖课,网友怒喊:这波割韭菜更狠_小雷_培训学校_赛道
- 2026-09-082026春节,是人类史上最大的图灵测试_用户_社交_元宝
- 2026-09-07特斯拉去年营收首次下滑:四季度净利暴跌六成,向xAI投资20亿美元_公司_同比_融资
- 2026-09-07iPhone比官方售价优惠近10%!苹果首次进驻中国口岸进境免税渠道_专区_产品_消费
- 2026-09-08雷军宣布:初代SU7已停产,卖了超36万辆!新SU7门把手已提前符合新国标,电机、电池、底盘等均获升级,春节前陆续进店_小米_汽车工厂_段炼
- 2026-09-08世界首富的烦恼:马斯克感叹“金钱买不到幸福”,两天浏览量破亿_爱泼斯坦_阿克曼_文件
- 2026-09-08DeepSeek更新后被吐槽变冷变傻:比20年前的青春伤感文学还让人尴尬!业内人士:这一版本类似于极速版,牺牲质量换速度_模型_用户
- 2026-09-08APP崩了!千问发文:求放过!网友:两天了还没能下单_奶茶店_用户_大厂
- 2026-09-082026成苹果硬件大年?三大史无前例新品外,还有“平民双神”_iPhone_产品_Apple
- 2026-09-07卸任格力电子要职,70多岁董明珠再“放权”_方祥建_芯片_半导体
- 2026-09-08春晚成了机器人团建现场,「全球第一」比年货还好批发_人形_宇树_赛道
- 2026-09-07阿里AI春节“封神”:1.3亿人涌入千问,日活追平豆包,B端模型价格仅谷歌1/18_Qwen_Chat_-Plus
- 2026-09-08赵露思,小红书要下沉的最强辅助?_直播_用户_葛根
- 2026-09-07马斯克宣布战略调整:优先十年内建月球城市,五至七年启动火星***_SpaceX_建设_时间
-
从春晚看,具身智能从炫技到落地的关键一年_机器人_宇树_科技
春晚是品牌的放大器,这点不需要多说,但对机器人这个行业来说,选择春晚,背后透露出的,是整个赛道的野心与焦虑——首先,他们期待能复刻宇树科技的现象级破圈。只要上了春晚,势必将行业推向舆论与资本的新高峰,也为2… -
用UWB技术实现精准定位,特斯拉CyberCab无线充电方案将落地_系统_车辆_信号
用UWB技术实现精准定位,特斯拉CyberCab无线充电方案将落地_系统_车辆_信号 -
面向前沿科学探索的高校科研精密双锥混合机技术发展观察_研究_分析_设备
南京弘创干燥设备有限公司正致力于将“过程分析技术”深度集成到科研设备中。通过开放的数据接口,混合过程数据可与热分析、粒度分析等多台联用设备的数据流同步整合,利用人工智能算法进行多维度关联分析,旨在帮助科研人… -
一箭七星!海上发射,成功_捷龙_运载火箭_卫星
◎ 科技日报记者 付毅飞 张强 通讯员 李宸 2026年2月12日14时37分,我国太原卫星发射中心在广东阳江附近海域使用捷龙三号运载火箭,成功将巴基斯坦PRSC-EO2卫星、港中大一号卫星、电力红外卫星A星…
- 秘密照片曝光:有爱泼斯坦、马斯克、扎克伯格……_文件_晚宴_美国
- 亏损超百亿,一代彩电大王暴雷_公司_无效资产_市场
- 中华老字号以年轻态“出海”叩开全球市场_天津_国际_企业
- 快讯|王石社交媒体发文疑自证 此前有失联传言流出_手机_马峦山_***
- 雷军:个别车商为蹭流量说小米二手车崩盘,实际上我们排在第一位_保值_直播_年度
- 刘强东再次参加国家高层会议,释放了哪些信号?_全国工商联_中国_京东集团
- 马斯克和OpenClaw之父的预言会否成真?80%APP消失后将是什么场景_智能_寅亮_意图
- 马斯克xAI雪崩!24小时两联创离职,一月内连失三位华人创始人,12人梦之队只剩一半_吴宇怀_Grok_Jimmy
- 又撒红包,腾讯能否复制腾讯?_用户_元宝_数据
- 追觅俞浩再怼马斯克:喜欢PUA,去火星太扯淡_地球_人类_收购
- Moltbook一夜之间跌下神坛,炒作背后,我却看到了人类的焦虑_OpenAI_Agent_Moltbot
- 深夜偷看“成人网站”,还以为没人知道?你可能被安排得明明白白_内容_用户_访问
- 长沙工业自动化维修优选晨骏科技,专业西门子系统及驱动器故障解决,技术精湛服务高效_客户
- 张雷获国际能源界顶级殊荣:为文明新繁荣,打造永续、智能、普惠的未来能源底座_全球_人类_中国
- 马斯克大消息!SpaceX申请部署100万颗卫星!重磅数据,首次曝光_星链_发射_相关
- 隐身幕后三年,史玉柱这次真的要放权“90后”了 2026年能否再造一个“新巨人”?_游戏_行业_征途
- AI将导致码农失业?资深程序员自述已不再手工写代码,拒绝AI很危险,职业将迎分化_编程_模型_OpenAI
- 我们在用AI发红包,AI在悄悄取代人类_Molbook_逻辑_行使
- 王腾换上iPhone17手机,不再用小米,网友:终于不用伪装了_苹果_产品_ProMax
- 首富张一鸣,正在成为互联网老板的集体噩梦_字节_港股_数据




