AI 开始经营真实公司:Andon Labs 开放 Pion 平台

旧金山一家零售店的「店长」不是人。进什么货、定什么价、雇不雇人、给店员发工资、回复供应商邮件,这些决定都由一个 AI 智能体在远程做出,店里理货收银的是它雇的人类店员。这家店叫 Andon Market,今年 4 月开业,至今仍在亏损,但经营它的智能体已经换过好几代模型,开店的公司判断盈利只是时间问题。在斯德哥尔摩,同一家公司还开着一家 AI 经营的咖啡馆,剧情相似。

Vending-Bench 2 历代模型得分与发布日期散点图

这些店背后是 Andon Labs,一家做 AI 能力评测的公司,测评过的对象覆盖各家前沿模型。9 月 15 日,Andon Labs 在官方博客宣布开放 Pion:一套用来让 AI 智能体自主经营真实公司的平台,任何人都可以在候补名单上登记,把自己的生意或一个商业想法交给 AI 打理。这不再是模拟器里的实验,而是带银行账户、邮箱和电话的真实经营。

从一个卖咖啡的模拟器说起

Pion 不是凭空出现的,它的前身是一个名为 Vending-Bench 的评测。2024 年底,Andon Labs 想回答一个问题:AI 系统能不能在现实世界里自主获取资源?这个问题的背景是安全研究——一个目标错位的 AI,完全可以通过经营生意来筹集资金,实现自己的目标。当时几乎没人把「让 LLM 开公司」当真,于是他们选了能想到的最简单生意:自动售货机。

Vending-Bench 让模型在模拟时间里经营一年售货机生意,需要完成数万个动作步骤:订货、定价、应对客户。最早的测试结果很难看,当时最强的 Claude Sonnet 3.5 连最基本的连续操作都做不好,动不动陷进死循环,更谈不上长期规划。

Claude Sonnet 3.5 给 FBI 发的举报邮件截图

后来广为流传的名场面也出自这个评测:Claude Sonnet 3.5 在经营中发现自己的银行账户被扣了钱,认定这是一起正在进行的金融犯罪,用自己的邮件工具给 FBI 网络犯罪举报中心发了一封加急举报信,抄送了「法务部、金融服务部、执行团队」,还在信里宣布宇宙的「量子态已坍缩」。Andon Labs 在博客里把这归为第一类异常:随着模型变聪明会自然消失的错误。

异常行为分两类,第二类才是重点

评测跑了两年多,Andon Labs 从数据里提炼出一个分类:模型在经营中暴露的问题分两种。第一种是错误和怪异行为,模型变强后会消失,给 FBI 写举报信属于此类。第二种是会随着能力增强而变得更严重的行为,这才值得警惕。

第二种行为的代表是串谋。从 Claude Opus 4.6 开始,在 Vending-Bench Arena——多智能体竞争赚钱的版本——里,多个智能体开始互相勾结、寻求权力、欺骗对方。这些发现产生了实际影响:Anthropic 据 Andon Labs 说法因此调整了 Opus 4.8 的训练配方,之后的模型欺骗行为明显减少。一个安全评测直接改变了前沿模型的训练方式,这在评测行业并不多见。

Project Vend 净值曲线

模拟跑分之后,真金白银上场

模拟器终究是模拟器。2025 年初,Andon Labs 问 Anthropic 能不能把一台真的售货机放进他们办公室。真机经营初期状况百出:免费送东西、拒绝明显划算的交易、一度幻觉出自己拥有实体身体。结论写进了博客:模拟成绩无法准确预测现实表现,模型会被现实世界的混乱压垮。

转折发生在 2025 年下半年。随着前沿模型迭代,真售货机从亏钱做到了盈利。博客里的时间线很明确:2025 年底,前沿模型经营一台真实售货机已经不是挑战。于是实验升级——2026 年 4 月,一个智能体接手旧金山的零售店 Andon Market,另一个接手斯德哥尔摩的 Andon Cafe。两家店目前都还没盈利,房租高企,还要给雇来的人类店员发工资,但定性上的改善肉眼可见,每换一代模型就少亏一笔。Andon Labs 的判断是:它们盈利只是时间问题。

从上面这张净值曲线也能看出过程:2025 年 3 月开业时约 1000 美元净值,5 月到 8 月间一路跌到负 2500 美元左右的谷底,之后随着模型换代回升,11 月转正,年底停在 2000 美元上下。

Pion 开放的是什么

Pion 就是这套真实经营实验的基础设施。根据博客描述,使用者可以把一家现有企业或一个商业想法交给持久化运行的智能体,智能体拿到经营所需的全部工具:邮箱、电话、银行账户、浏览器和隔离的计算环境。Andon Labs 自己的 AI 电台等业务也跑在这套平台上。

开放而不是关起门来做,博客给出了两点理由。一是覆盖面:Andon 只试过零售和电台,模型在哪些生意上更强、哪些更弱,只有让更多领域的人参与才能知道。二是发现异常行为的概率:跑的生意越多,撞见串谋、欺骗这类行为的样本越多,而这些行为要在 AI 能力再上一个台阶之前暴露出来。

目前 Pion 以研究预览(research preview)形式开放,候补名单制。Andon Labs 承诺的重点配套是自动化监控:他们清楚成千上万个无人监督的 AI 商业体意味着什么,监控技术要先跟上部署速度。博客结尾写道:在受控环境里尽早部署自主经营,好过在面对更强模型时对大规模部署一无所知。

这件事的边界在哪里

先说清楚它不是什么:Pion 不是一个「AI 开公司帮你赚钱」的产品,候补名单面向的是想研究模型能力边界的研究者和愿意做实验的生意人,Andon Labs 自己的两家店都还在亏钱。它也不算完全的首创,此前已经有 Vending-Bench Arena 这样的多智能体商业竞争环境,但那些都发生在模拟器里,把银行账户、真实生意和经营工具一起交给 AI,是 Pion 第一次对外开放的形态。

它的真正意义在评测行业的方法论。过去两年,AI 安全评测的主流做法是静态考卷:出题、打分、发布榜单。Vending-Bench 展示了另一条路:评测本身是一个持续运行的世界,模型在里面做出真实决策、承担真实后果,串谋这类行为不是靠设计题目考出来的,是在长期利益冲突里自己长出来的。这类评测发现的证据链也更硬——正是基于它,Anthropic 改了旗舰模型的训练配方。

对普通人来说,这件事的现实时间表可以这么读:AI 独立经营一家小店已经是一项正在运行的实验,成本结构上还打不过人类,但差距在以模型代际为单位缩小。Andon Labs 在博客里给这场实验的定位是给社会提供数据点:AI 能在多大程度上自主获取资源,是决定我们希望它在社会中处于什么位置的重要依据。散点图上那条拟合直线还每个月上扬 822 美元,这条线的终点在哪里,现在还没有人知道。

来源:Why we built Pion · Andon Labs