Ox Alpha:挑战 Claude Fable 与 GPT-5.6 的免费匿名模型
前言
Ox Alpha 于八月下旬出现,作为一个隐匿的多模态模型,在路由平台上可用,但没有明确的作者标示。本文总结了已知的关于其性能、可用性与来源推测的信息。文章说明了该模型为何迅速引起注意、基准测试的主张如何扩散,以及独立分析对其可能制造者的推测。目的是清楚陈述证据与背景,让读者在没有炒作的情况下判断这些主张与其影响。
懒人包
Ox Alpha 在路由服务上公开推出,作为一个免费且高容量的模型。早期小样本结果显示它在代码任务上击败了 Claude Fable 5 与 GPT-5.6 Sol,但更大规模的完整测试分数则让它与 GPT-5.6 大致齐平。提供者尚未自我识别;独立指纹比对指向了 智谱 AI 的 GLM-5.3 系列,虽然模型的多模态视频支持暗示可能是未发布的升级版本。可用性、token 吞吐量与隐匿发布模式解释了该实验室可能在正式公告前测试使用情况的原因。
主文
在 8 月 20 日,Ox Alpha 出现在多个路由门户与网关,作为一个公开可调用但未附带公司名称的模型。列表将其描述为一个以推理为重点、适合代码、长时间运行代理任务与生产工作负载的模型。数小时至数日内,该模型因三个原因受到关注:在有限时段内免费使用;接受文字、图像与视频输入并返回文字输出;以及早期病毒式分享的样本显示其代码能力异常强劲。
该病毒性主张来自一名开发者,他在 DeepSWE 上运行了 10 题样本测试,DeepSWE 是衡量代码代理在第一次尝试时正确解决真实 GitHub 问题频率的基准。那个初期小样本给予 Ox Alpha 80% 的通过率,领先于 Claude Fable 5 的 65% 与 GPT-5.6 Sol 的 52%。由于样本数小,这一发现令人振奋但统计上不稳固——它可能反映题目选择的变异,而非决定性的优势。
随后,更完整的 113 题测试显示 Ox Alpha 得分约为 63%,大致与 GPT-5.6 Sol 相近,并未明显超越现有最先进水平。这些数字使最初的兴奋降温:虽然 Ox Alpha 在一个具有挑战性的真实世界代码基准上具竞争力,但早期的病毒性主张高估了证据强度。
除了性能之外,Ox Alpha 的发布机制也值得注意。该模型提供非常大的单一上下文窗口——据报可达约一百万 token——并接受多种模态(文字、图像、视频)。它也支持工具与函数调用,尽管其 JSON 输出未强制使用 schema,对期望从工具获得结构化响应的代理开发者而言,这可能是一个实践上的不足。
该模型通过多个途径提供:OpenRouter 将其列为 stealth/ox-alpha;其他网关如 OpenCode、Cline 与 Nous Research 也提供访问。提供者宣称慷慨的吞吐容量(OpenCode 宣称每日容量约 100 兆 token;Nous Research 暗示更高数字),这意味着在预览期间支持大量真实世界使用的意图。能力与免费测试的结合,对实验室而言是收集生产反馈的有吸引力方式。
当知名人士与公司发表评论时,关注程度加剧。一位知名科技高管的简短背书助长了讨论与更广泛的测试。然而,没有实验室公开宣称作者身份。这份匿名性引发了一阵猜测。观察者提出的候选者包括大型中国与国际实验室——微软 (MAI)、小米 (MiMo)、阿里巴巴 (Qwen)、Google (Gemini)、DeepSeek 与智谱 AI——各方支持者引用各种行为线索来支持他们的理论。
经过仔细比较后,范围被缩小。若干提出的匹配在具体技术点上无法对齐:有些候选模型接受音频输入(而 Ox Alpha 拒绝),有些缺乏视频能力,还有些使用不同的 tokenizer 与视频编码器。独立的指纹比对更具决定性:多项测试将 Ox Alpha 的 tokenizer 与 GLM-5.3 相匹配,并显示其视频 token 消耗模式与 GLM-5V-Turbo 相符。Ox Alpha 也呈现出 GLM 系列模型观察到的独特错误模式与音频拒绝行为。这些趋同的迹象使智谱 AI 的 GLM 系列成为最可信的来源。
仍有一个曲折。GLM-5.3 在 Ox Alpha 出现前不久以纯文本形式发布,而 Ox Alpha 则具有多模态支持,这暗示 Ox Alpha 可能是多模态修订版或内部变体,而非简单的重新打包。分析师开始以 GLM-5.3 Flash 来称呼这一假设,反映出具备新增视频能力的近亲概念。智谱 AI 在预览期间并未公开确认或否认这一关联。
Ox Alpha 也说明了越来越普遍的“隐匿”发布做法:实验室通过路由平台发布强大的模型而不揭露来源,以收集使用数据并在正式公开前进行迭代。中国实验室特别多次采用此方法;此前的匿名发布在数日到数月内被追溯到已知产品线。这一模式帮助实验室在大规模测试模型并观察真实世界交互的同时,保留最终披露与包装的灵活性。
对于开发者与组织而言,情况既带来机会也需谨慎。限时免费访问让多人尝试该模型并收集经验印象。但对来源的不确定性、未记录的输出 schema 限制,以及短暂的免费时窗,均主张在将模型用于生产系统前应谨慎评估。像 DeepSWE 这类基准为比较提供有用且客观的基线,但小样本的病毒性结果不应取代在具代表性的任务上进行全面测试。
简而言之,Ox Alpha 是一个具竞争力、高容量的匿名多模态模型,以公开预览方式提供。早期病毒性样本显示其在某些代码任务上可能胜过领先对手,但更完整的测试则使其与顶级模型大致齐平。独立技术指纹最强烈地指向 GLM-5.3 系列的底层架构,可能是一个未发布的多模态变体。隐匿发布符合实验室在正式揭露前寻求真实世界反馈的常见模式。观察者应关注后续披露或更多技术分析,以确认该模型的来源与能力。
关键洞见表
| 面向 | 说明 |
|---|---|
| 发布与可用性 | Ox Alpha 以匿名方式在 OpenRouter、OpenCode、Cline 与 Nous Research 门户上推出,并在有限预览期间提供免费使用。 |
| 性能主张 | 一则病毒性的 10 题样本显示 Ox Alpha 优于 Claude Fable 5 与 GPT-5.6 Sol;完整的 113 题测试则将其置于约 63%,与 GPT-5.6 Sol 大致相当。 |
| 能力 | 据报为多模态(文字、图像、视频输入),支持非常大的上下文窗口(约 1M token),并支持工具/函数调用,但未以 schema 强制 JSON。 |
| 基础设施 | 网关宣称非常高的 token 吞吐量(例如每日 100T token),暗示已准备好进行大量真实世界测试。 |
| 归属 | 没有实验室宣称该模型;独立指纹比对最强烈指向智谱 AI 的 GLM-5.3 系列,可能为未发布的多模态变体。 |