/ V; P3 C7 n2 D. d' k. F更关键的是,METR(Model Evaluation & Threat Research)在2025年发布的开发者生产率随机对照试验(RCT)提供了直接反例。该研究在真实开源代码仓库中测试了经验丰富的开发者在有无AI工具辅助下的任务完成速度,结果发现:允许使用AI工具的开发者平均多花了19%的时间完成任务——不是快了,而是慢了。研究者明确指出,基准测试中的高分数可能不会直接转化为真实生产环境中的效率提升,因为真实任务涉及更复杂的上下文理解、代码库熟悉度和协作流程。如果在相对规范化的开源项目中AI尚且无法稳定提升效率,那么在更加复杂、更加定制化的企业软件环境中——涉及私有API、内部安全策略、业务特定逻辑——期望AI在"几周内复刻"生产级系统就更加不切实际了。原文的论证策略是把"技术演示"(demo)等同于"生产部署"(production),把"可能性"等同于"普遍性"——这是技术乐观主义与技术恐慌主义共享的认知偏差。 ( P8 M) v2 ?8 Y5 m* U! W- X 2 i! L1 j0 ^ m4 q$ w2 e从公司财报和行业观察来看,截至2025-2026年,ServiceNow、Salesforce、Workday等头部SaaS企业的净收入留存率(Net Revenue Retention Rate)普遍仍维持在110-130%的区间,意味着既有客户不仅没有流失,反而在增加支出。部分企业确实面临增长放缓的压力,但这更多反映了宏观周期和IT支出优先级调整,而非原文所描绘的"AI工具几周内复刻核心功能→客户大规模流失"。福布斯等商业媒体的报道也指出,虽然有企业尝试用AI工具替代部分SaaS功能,但绝大多数仍选择在既有平台上叠加AI能力,而非推翻重来——因为替换成本实在太高。这些平台深度嵌入了客户的业务流程、数据管道和组织工作流,"复刻核心功能"完全无法触及这一层深度集成。- f) \" }, o- U/ X6 y: m. Y
I* ]8 t. J) }: e. i
METR的研究发现在这里提供了一个更广泛的方法论警示:它说明,AI能力在基准测试环境中的表现与在真实生产环境中的表现之间存在系统性差距。原文反复引用的"AI能力跃迁"很可能更多反映的是基准测试分数的提高,而非真实世界效率的同等提升——这一差距是整篇文章"两年内经济巨变"叙事的阿喀琉斯之踵。/ e. K# }5 Y0 c1 Q! f
6 a$ Y. j( I2 t& P" Q- n+ O, N6 T, X四、"摩擦消除"与"代理经济"——在制度、信任与能源面前的幻想 ; m& L& ^0 n/ Z3 K; ]/ q0 g( n : A. p k y" \; y7 l! p6 ~在技术能力断言的基础上,原文进而系统性地推演了AI对各行业的冲击。其核心逻辑是"摩擦消除论":AI代理将系统性地消除信息不对称或流程复杂性,使得依赖中介服务获利的行业全面萎缩。文章列举了保险续保、旅行预订、税务咨询、法律服务、超市配送、房地产经纪、信用卡支付等诸多领域,甚至声称到2027年AI代理将成为消费者生活中的"默认基础设施"——在后台持续运行,自动帮用户续保险、找最低价、做税务、谈价格,消费者像接受"自动完成功能"一样自然地接受代理的全面介入,"中间商将无立足之地"。原文还引用了一个虚构的"2027年3月"数据点——美国成年人日均token消耗中位数达到40万——作为代理经济全面铺开的量化标志。 5 M5 F4 r9 j, {0 W : N7 G* P G. ?6 R; f& A这一宏大叙事犯的根本性错误是将三种性质完全不同的"摩擦"混为一谈。第一种是信息摩擦——即消费者因信息不对称而支付更高价格,这种摩擦确实可能被AI代理显著降低。第二种是制度摩擦——即由法律、监管、资质要求、责任归属等制度安排所创造的复杂性,这种摩擦不能被技术"消除",因为它本身就是社会有意设置的风险管理机制。第三种是社会摩擦——即由信任、情感、文化偏好、人际关系等因素所驱动的复杂性,这种摩擦根植于人类社会的基本运作逻辑。原文将所有这些摩擦统统归为"AI可以消除的低效",并把"辅助"直接等同于"替代"。 2 U, }& k' L' D7 F: ^7 d) U- I5 b$ g4 Z3 J7 @, v
以税务咨询为例:AI确实可以自动化标准化的报税流程(信息摩擦部分),但涉及跨境税务筹划、争议解决、审计应对等高价值服务时,法律解释的开放性、监管机构的裁量权、以及客户与顾问之间的信任关系都是AI难以替代的。当一个AI代理为客户提供税务建议时,谁为错误建议承担法律责任?当一个AI代理替客户签署保险合同时,合同是否具有法律效力?这些问题并非"技术可行即可解决"的工程问题,而是需要立法、司法判例和监管框架共同演进的制度问题。斯坦福大学HAI的报告指出,在医疗、法律、金融咨询等高风险领域,AI系统的实际部署受到专业资质要求、错误后果严重性和消费者信任度的多重约束,其价值更多体现在"增强人类专家的能力"而非"替代人类专家"。OECD的报告也多次强调,AI自动化对就业的影响是"任务级"的而非"岗位级"的——即AI通常替代的是一个岗位中的部分任务,而非整个岗位。原文将"任务自动化"直接等同于"岗位消灭",是其分析中反复出现的逻辑跳跃。" E0 |* U+ l4 \; e) ?
- o( E$ t) \9 d# n7 P房地产和消费支付领域的推演同样经不起制度现实的检验。原文声称AI代理将压低房产佣金至接近零,但美国房产交易中的法律合规、产权调查、按揭协调、验房等环节都有独立的制度要求和从业资质门槛——即便没有AI干预,行业佣金结构的调整也需要修改行业惯例、调整MLS规则、重新定义买方代理义务等多层制度变革,需时数年。原文更大胆地提出,AI代理为了节省2-3%的信用卡交换费将系统性地将支付路由切换到Solana或Ethereum L2上的稳定币结算,重创Visa和Mastercard。然而,信用卡网络之所以能收取2-3%的费率并持续数十年,恰恰因为它提供的不仅是支付通道,还有一整套信任基础设施:欺诈检测与防护、争议仲裁机制、全球商户受理网络、信用功能、以及附加的保险和积分奖励。Visa自身虽已宣布在部分场景中接入USDC结算,但这面向机构客户而非消费者。消费支付市场受各国消费者保护法、反洗钱和KYC法规的严格约束——金融时报的报道指出,各国监管机构对稳定币用于零售支付的态度从谨慎到严格不等,美国国会关于稳定币立法的讨论截至2026年初仍在进行中。大规模"绕开Visa/Mastercard"的设想需要同时跨越技术、监管、商户接入和消费者保护等多重门槛,这不是两年内可以完成的。OECD在其关于平台经济和竞争政策的报告中还指出,"代理对代理"的自动化竞争模式虽然在理论上可以提高市场效率,但也引发了算法共谋、价格歧视、数据滥用、消费者自主权被侵蚀等新的监管问题——这些问题本身就会催生新的监管介入,从而减缓"摩擦消除"的速度。技术存在不等于制度允许,制度演变的速度从来不以技术进步的速度为准。 2 R6 y6 p1 h/ t ' Q# `0 o! [+ R% }9 J& t# m/ h e关于消费者采纳速度,"AI代理2027年成为默认基础设施"的预设更是远超当前现实。这需要两个前提同时成立:AI代理在高风险消费决策中足够可靠和安全,以及消费者愿意将这些决策交给机器。斯坦福AI Index报告总结的研究显示,在ToolEmu框架的测试中,即便是安全优化最充分的LM代理,在关键场景中仍有约23.9%的失败率——包括执行危险指令、发起错误金融交易等。将近四分之一的关键场景失败率,与原文所描绘的"代理自动替你做税务、买保险、签合同"的畅通假设之间存在不可忽视的鸿沟。OECD在2025-2026年的调查数据显示,报告使用AI的企业占比仅为20.2%左右,消费级AI代理的采纳更加滞后。从历史经验看,从ATM到网上银行,从电话购物到移动支付,每一种消费金融技术的大规模渗透都经历了十年以上的周期。原文假设AI代理在不到两年内从"早期试用"跃升至"默认基础设施",与技术扩散的历史规律严重不符。* Q+ m7 |" w4 E2 j
$ M5 q2 {" a2 ^3 g. t$ }
至于人均日消耗40万token的虚构数据点,从当前技术参数来看,这意味着每个美国成年人每天相当于进行数十次长对话或数百次复杂查询——不仅需要远超当前规模的推理基础设施,还需要巨额能源供给。国际能源署的报告指出,AI相关电力需求正以每年两位数速度增长,部分地区已出现数据中心电力供应瓶颈。如果将40万token/天外推到2.6亿美国成年人,所需的推理算力和电力将是天文数字——而原文对此完全没有讨论。将一个缺乏推导过程的虚构数字作为宏观论证的关键支点,再次反映了原文以"精确数字创造确定性幻觉"的叙事策略。! L4 A/ G/ U/ u! r
, T1 M& H' C/ R; I+ T% D& @ 五、金融传染叙事的解构——真实的脆弱性,虚构的触发器" f7 e$ g: l- v7 n2 M3 A! }9 x, O# h
+ f- ~5 ^+ t \* C' m/ g. ~3 X: w
在经济和行业冲击的叙事之后,原文将分析推向金融层面,构造了两条传染链条:一条从白领收入崩塌通向13万亿美元住房按揭市场,另一条从企业贷款违约通向私募信贷—寿险—再保险链条的系统性崩溃。 : g( ?$ ^ n D E/ a8 C5 {( K2 z, s, e; w
先看按揭市场。原文将"白领收入崩塌"直接连接到美国住房按揭市场,声称"780 FICO分、20%首付的优质借款人"的偿债能力高度依赖白领薪资,而AI替代将使这些原本"安全"的贷款变得不再可靠。这一论述的震撼力来自其反直觉性,但反直觉不等于正确。"白领收入是优质按揭的基础"这一前提过度简化了美国房贷市场的结构。美国的按揭承销过程不仅评估借款人当前收入,还综合考量信用历史、资产储备、债务收入比、就业稳定性等多维指标。780 FICO分数的借款人通常拥有多年良好的信用记录和一定的储蓄缓冲——即使发生短期收入中断,其违约概率也不会像原文暗示的那样迅速飙升。路透社在2023年的报道中指出,美国房贷体系在2008年危机后经历了系统性的承销标准收紧,当前的优质贷款组合在压力测试中表现出远高于次贷危机前的韧性。7 d4 r' t: Z" p; K2 N9 G( K. N1 U- b' j
! I2 O5 o0 {$ c% l+ H2 _1 m b更重要的是,原文假设白领失业是大规模的、持久的、且没有任何政策缓冲的——但这三个假设中任何一个不成立,整个按揭危机叙事就会大打折扣。如果失业是摩擦性的(白领在数月内找到新岗位或转型),按揭违约率不会显著上升。如果政府介入(延长失业保险、提供按揭宽限期、降低利率),违约率同样会被抑制。2020年COVID期间,美国联邦政府和住房机构(Fannie Mae、Freddie Mac)在数周内推出了大规模的按揭宽限计划(forbearance programs),使得即使在失业率飙升至14.7%的情况下,实际止赎率也远低于2008年。值得注意的是,原文自己在极端情景中也承认"违约率仍远低于2008年水平"——但它随即用"轨迹才是真正的威胁"将叙事推向更恐怖的方向。这种"当前数据不支持我的结论,但趋势会证明我是对的"的论证方式,恰恰是恐慌叙事最常用的修辞结构:它永远无法被当下的数据证伪,因为它的"证据"总在未来。% i( [! q% s( w9 r3 O- Z; y
. z$ A# c0 q& v( L9 f2 X3 G
再看私募信贷链条。原文详细描绘了一个金融传染路径:私募信贷规模飙涨至2.5万亿美元以上→大量寿险资金被私募股权收购的保险公司投入私募信贷→再保险通过离岸结构转移风险→评级机构未能充分反映底层资产恶化→AI引发的白领失业导致消费贷款和企业贷款违约率飙升→链条断裂→系统性金融危机。公允地说,原文对私募信贷—寿险—再保险链条的描述并非空穴来风。国际货币基金组织(IMF)、金融稳定委员会(FSB)和芝加哥联储等机构均已关注私募信贷的快速膨胀、估值不透明、流动性错配等风险——这些是真实存在的金融脆弱性,对此应予承认。 9 v1 S: |2 w" v+ s' B+ ]1 F# X & ^7 w, t# P/ j" y! y然而,原文犯的根本性错误是把一个可能由多种触发因素引爆的真实脆弱性,绑定到了一个特定的、高度不确定的触发器上——即"AI在两年内替代通用白领劳动力"。这等于说:炸弹是真的,但引爆它的那根导火线是想象出来的。私募信贷的风险可能被利率走势突变、地缘政治冲击、商业地产持续下行、某个大型基金管理人的信用事件等任何因素触发,将AI替代设定为唯一触发器,更多是为了服务其整体叙事的连贯性。此外,从2008年金融危机以来,全球金融监管体系已经建立了远比当时更完善的宏观审慎工具:逆周期资本缓冲、压力测试框架、系统重要性机构的额外资本要求、以及对影子银行的加强监控。IMF的全球金融稳定报告虽然对私募信贷的风险表示关注,但同时也指出监管机构正在积极收集数据和完善监管框架。FSB在其关于非银行金融中介的年度报告中更明确指出,虽然私募信贷的透明度不足令人担忧,但该市场的杠杆水平、交叉暴露和流动性错配程度目前远不及2008年前的结构化信贷市场。将私募信贷的风险与次贷危机相提并论,需要更多的实证支撑,而非原文那种纯叙事性的类比。 ; L2 U' l, N4 b- Z- i$ t4 A: h% D5 ^7 F4 Y K d) j4 z
在市场信号的解读上,原文同样犯了归因错误。它以NVIDIA、台积电股价走强与美国债市利率下行为证据,声称市场已经在"定价"AI引发的结构性变革——资本涌向算力供应链,同时债市反映未来消费崩塌预期。但NVIDIA和台积电的股价走强反映的是全球对AI训练和推理芯片的需求,来自科技巨头的资本开支竞赛、云计算厂商的基础设施扩建等多重因素,与"白领消费将崩塌"几乎没有直接逻辑联系;美国债市利率下行同样受到联储货币政策预期、全球避险情绪、通胀数据走势、海外央行需求等多重因素驱动。路透社在2025年的金融市场分析中指出,当时的利率走势更多反映了市场对美联储降息节奏的预期调整。把两个独立的市场现象用一个统一的叙事串联起来制造因果关系的幻觉——这是典型的"叙事套利"(narrative arbitrage),是投研内容中常见的认知偏差,也是原文反复使用的修辞手法。 7 M( f. b1 w5 P' p# ~+ \ ( m' N6 h1 t4 G1 X- v0 V六、劳动市场叙事——"全白领服务经济"的迷思与"阶梯下滑"的戏剧化% e6 z* ]5 m! W! E. N0 H2 R
# `( @9 e' K. m6 P6 O! Y4 J& j原文对劳动市场冲击的描述建立在一个关键的结构性断言之上:美国经济本质上是"全白领服务经济",白领占就业的50%、贡献了75%的可选消费支出,因此AI对白领的冲击将直接摧毁整个消费基础。这一断言将"服务业"等同于"白领",再将"白领"等同于"可被AI替代的岗位"——是一系列不加限定的简化。根据美国劳工统计局(BLS)的数据,美国非农就业中,广义的"办公室类"(office and administrative support)岗位约占11-12%,而更广泛的"专业和商业服务"虽然占比较高,但其内部异质性极大——包括清洁服务、安保服务、临时劳务派遣等大量非白领岗位。将所有服务业就业都归为"白领"会严重高估AI替代的直接影响面。"白领贡献75%的可选消费"这一数字更是缺乏明确的数据来源和定义标准——可选消费的定义本身就有争议,不同定义下白领的贡献占比差异显著。简单地把"白领=可选消费=AI冲击=经济崩溃"这条链条画出来,忽略了劳动市场中持续发生的结构调整、技能转型和岗位重新定义,是对复杂经济系统的严重过度简化。 & A2 H) M' d% ?+ D3 [ " z# ~4 u+ L" J原文还特别将冲击链条延伸到全球——声称NVIDIA、台积电等AI基础设施企业将逆势繁荣,而印度IT外包行业将遭受毁灭性打击。AI芯片和数据中心确实受益于全球AI投资热潮,但将印度IT行业的挑战单纯归因于AI替代,是以偏概全。印度IT外包行业面临的压力来自全球科技支出放缓、主要客户的成本削减压力、印度国内的工资通胀、以及来自东南亚和东欧的竞争等多重因素。国际劳工组织(ILO)的研究明确指出,生成式AI对全球就业的影响呈现明显的行业、性别、国别差异——不能用一个统一的"替代"叙事覆盖所有地区和行业。ILO的分析框架强调,AI的总体效应更可能是"增强而非完全替代"——对印度IT行业而言,AI更可能意味着业务模式的转型,而非行业性崩溃。* O$ e, I3 _- _! U7 ^8 l* z
# ? @8 I. e$ m) |! P, y# }6 s原文中最具戏剧性的劳动市场叙事,是所谓的"阶梯下滑":高薪白领(如产品经理)被AI替代后,被迫进入零工经济(送外卖、开网约车),随后又被自动驾驶和无人配送取代——形成双重打击,失业率不可遏制地飙升。这一叙事的戏剧性远大于其分析性。社会学和劳动经济学的研究表明,高技能工人在面临失业时的行为模式远比原文描绘的更加复杂和多元。OECD的未来工作报告指出,高技能劳动者在失业后的主要路径包括:转行到相关领域(利用可迁移技能)、接受再培训后进入新兴行业、创业(利用行业知识和人脉)、以及暂时退出劳动力市场(依靠储蓄或家庭支持)。直接从高薪产品经理"下沉"到外卖骑手,虽然在个案中可能发生,但作为大规模的系统性现象则缺乏证据支撑——因为高技能工人通常拥有更多的储蓄缓冲、更强的社会网络和更广泛的就业选择。 . s& J& A4 Y' k7 k7 f; v0 L. [9 c4 Y U& k. U
此外,原文将"自动驾驶取代零工"作为第二波打击,但截至2026年,自动驾驶的规模化商用仍然面临技术(长尾场景处理)、监管(各州法规不一)、保险(责任归属)和基础设施(车路协同)等多重障碍。将一个自身时间线高度不确定的技术叠加到另一个时间线高度不确定的技术之上,产生的不是分析洞见,而是恐慌叠加。更重要的是,每一次重大技术变革都伴随着新职业的出现——这不是盲目乐观,而是历史规律。ATM没有消灭银行柜员(分支机构反而增加了),电子表格没有消灭会计师(反而创造了更多的分析师岗位),互联网没有消灭中间商(反而催生了全新的平台经济生态)。原文声称"这次不一样,因为AI是通用的"——但如前文所述,这一"通用性"的断言本身就缺乏证据支撑。 $ x+ J# C) E% T) E* I% g7 L( t) k2 I; r u2 c: J/ W! n
未完待续 4 L6 T8 e, C; E作者: xiejin77 时间: 2026-2-28 08:48 七、被系统性忽视的调节力量 $ M# w9 X9 I' N& B$ {" f& u" }5 f
在以上各维度的具体批判之外,有必要指出原文在整体叙事框架上系统性忽视的三股调节力量。/ F+ Q/ D' A- p D9 K% K6 a* |+ t
. Y0 X* A- ]1 M- R. Q5 |第一,国家的财政—金融调节能力被预设为瘫痪。 原文虽然讨论了"算力税"和转移支付方案,但将政策进程设定为"左右互骂、持续滞后、来不及反应"。然而,历史反复证明,当危机足够严重时,国家的反应速度可以非常快——2008年金融危机期间TARP方案在数周内通过,2020年COVID期间CARES法案以前所未有的速度立法。原文将国家能力预设为僵化,是为叙事服务的设定,而非对制度韧性的客观评估。, V- ~3 F, C& U! y2 N9 w
& ^0 d1 E2 J/ p) a. s
0 J3 a' ~( N( j! H" j
第二,垄断与集中的双重效应被选择性忽略。 原文一方面预设"摩擦型租金被代理清零"(平台护城河消失),另一方面又预设"算力租金可长期集中攫取"(NVIDIA、TSM逆势繁荣)。但这两个假设在逻辑上存在自相矛盾:如果AI代理真的能消灭一切中介摩擦,那么控制AI代理的大平台和大模型提供商本身也会面临去中介化的压力——除非它们通过数据壁垒、知识产权、排他协议和监管俘获来维持垄断。原文对前者大肆渲染,对后者几乎不着墨,选择性地忽略了垄断资本自我保护的强大能力。 3 ^5 D% \6 e7 |4 f# F. l) w( z' I
第三,劳动者的集体行动与政治反馈被降格为背景噪音。 原文虽然虚构了"占领硅谷"运动,但仅将其作为社会氛围的装饰,而非分析资本—劳动博弈如何通过政治过程反作用于技术扩散速度。现实中,当技术变革威胁到足够大的社会群体时,政治反弹会直接影响监管框架和技术部署节奏——欧盟AI法案、各国对算法管理劳动的立法、好莱坞编剧罢工、以及美国码头工人工会对自动化的成功抵制都是近年的例证。 , I( h6 }) } D& f/ f; Z; h/ A2 V* q/ ]9 `