有头有脸的大模型公司,大我搞起「匿名公测」_新浪财经_新浪网
时间:2026-09-12 16:03:55 来源:拾人涕唾网
原标题:有头有脸的有头有脸大模型公司,大我搞起「匿名公测」最近,大大搞海外开发者圈又被一个没有名字的模型名模型刷屏了。8 月 20 日,公司OpenRouter 上多了一个叫 Ox Alpha 的起匿模型,100 万 token 上下文、测新支持图片和视频输入、浪财浪网能调用工具、经新免费。有头有脸随后,大大搞它被接进 OpenCode、模型名Hermes 等编程 Agent。公司有人拿它修代码,起匿有人用它跑软件工程基准,测新还有人盯着 tokenizer 和报错信息,浪财浪网试图猜出它到底是谁家的。目前,Ox Alpha 的身份还没有得到官方确认。社区最 流行的猜测是,它与智谱 GLM-5.x 系列关系很近;依据是 tokenizer、推理模式报错和部分输出习惯的相似性。但这还只是技术分析,智谱官方目前还没有认领。从 Ox Alpha 爆火,可以看到一个越来越常见的出海打法:模型先匿名上线,让海外开发者替它做第 一轮测试、传播和身份鉴定。01从 HappyHorse 到 Ox AlphaOx Alpha 并不是第 一个蒙着脸跑出来的模型。往前翻四个月,阿里的 HappyHorse(欢乐马)也是这个路数—— 没有发布会,没有公司名,直接空降到 AI 评测平台 Artificial Analysis 的 Video Arena 榜单上,一度把字节 Seedance 2.0 和快手可灵 3.0 挤到身后,登顶榜一。讨论热度起来几天后,阿里确认,HappyHorse 来自 ATH 创新团队。今年以来,OpenRouter 上接连出现了一批「Alpha」模型。2 月,Pony Alpha 上线,后来被 OpenRouter 标注为 GLM-5 的早期测试版本;3 月,Hunter Alpha 被小米认领为 MiMo-V2-Pro 的早期测试版本;4 月,Elephant Alpha 上线后揭晓为蚂蚁 Inclusion AI 的 Ling-2.6-flash。Pony Alpha、Hunter Alpha、Elephant Alpha 的模型页上,如今都留下了这段「前身」记录。匿名测试本来就是 OpenRouter 长期存在的机制,OpenAI、xAI、NVIDIA 等团队都曾用过类似方式。只是从 HappyHorse、Pony Alpha 到 Ox Alpha,中国团队越来越熟练地把海外开发者平台当成新品的第 一站。这背后的逻辑不难理解。大模型出海,厂商真正要争取的并不只是一次新闻曝光,而是进入开发者的日常工作。DeepSeek 和 Qwen 已经在海外社区积累了不少认知,但更多中国团队仍处在「听过,但没用过」的阶段。直接挂着公司名发布,开发者未必会专门去试;一个神秘代号,加上免费、长上下文、Agent 这些关键词,更容易让人点开。它们也选对了地方。HappyHorse 去的是视频模型盲测榜单,排名变动本身就会成为话题;Ox Alpha 进入的是 OpenRouter 和 OpenCode。前者是开发者选模型、比价格的入口,后者直接连着编程 Agent。用户不要求下载新软件,也不用重新学习一套工作方式,换个模型就能让它开始读代码、跑任务。这和过去的发布会逻辑不太一样。以前,厂商先告诉市场「我很强」,再等待用户来印证;现在,模型先被扔进开发者的工作流,用户用几天就会给出答案。渠道选对了,匿名本身就成了一种营销。02匿名上线,开发者一边测能力,一边给它「验明正身」Ox Alpha 上线后,海外社区很快出现了两种不太一样的声音。一边是惊喜。社区流传的一组 DeepSWE 测试中,Ox Alpha 在 10 个软件工程任务里通过了约 8 个,成绩高过同场测试的几款知名模型。对一款刚上线、连开发者是谁都不知道的模型来说,这个结果足够吸引注意力。但另一边,质疑也来得很快。10 个任务只是很小的样本,每多过或少过一道题,分数都会变化 10 个百分点。后来出现的更大样本社区复测,结果回落到约 63%。这个数字同样不是官方审计榜单,只能作为参考。它至少说明,匿名模型上线初期,最容易被放大的往往是小样本里的惊喜。还有研究者拿 Ox Alpha 跑更偏抽象推理的 INDUCTION 基准,得到的结论也没那么乐观:它的成绩落后于 GPT-5.6 Luna 和 DeepSeek V4 Pro,仅略过量 Gemini 3.7 Flash;为了得到 87 个可评估结果,测试者调用了 551 次 API,期间多次遇到空回答和接口错误。他自己也无法确认,这些问题究竟主要来自模型,还是来自 OpenRouter 的接入链路。这些结果并不必然互相矛盾。今天的 Agent 模型,很难只靠一张 benchmark 表判断好坏,模型、推理档位、工具调用、网关和具体任务,都会改变最终结果。它答对一道题,和它能不能在一个真实代码库里连续工作两个小时,是两件不同的事。开发者真正关心的是,它能不能理解品种结构,工具调用会不会出错,任务做到一半会不会停住,失败后能不能自己恢复,上下文拉长后还记不记得最初目标。开发者也在试图找出它是谁。由于厂商没有公开说明,社区只能从模型的行为里找线索:一句话被切成多少 token,错误参数会返回什么提示,把 temperature 调到 0 后会怎样组织答案,甚至中文提示词下会不会显出某种习惯。目前最 流行的猜测是,Ox Alpha 与智谱 Z.ai 的 GLM-5.x 系列关系很近。社区发现,它的 tokenizer、推理档位报错,以及部分固定条件下的输出习惯,都和 GLM-5.3 很接近;Ox Alpha 又支持图片和视频输入,而公开的 GLM-5.3 主打文本能力,这也让不少人猜测它可能是一个尚未发布的多模态变体。这个过程本身说明了匿名发布的一个特点:匿名模型一上线,开发者社区很快就会接手后面的工作:有人跑测试,有人拆参数,有人翻报错,有人沿着 token 计数一路猜到模型可能出自哪家。开发者一边当公测用户,一边也做了媒体、分析师和测试工程师的活。03匿名能带来真实反馈,也把更多问题留给了用户如果模型一开始就挂着 OpenAI、Google、阿里或智谱的名字,用户很难完全摆脱预期。有人会因为品牌愿意多给它几次机会,也有人会因为对某家公司的印象,连试都不想试。匿名以后,开发者先看到的是结果:代码写得怎么样,工具会不会调错,长任务能不能做完,价格值不值得。OpenRouter 联合创始人 Alex Atallah 此前回顾 Quasar Alpha 的匿名测试时提到,平台和模型团队想看的,是用户在不知道模型开发者是谁的情况下,会怎样使用和评价它。对模型团队来说,这能减少品牌带来的预设,也能更快拿到真实反馈。这也是为什么匿名模型总能迅速调动开发者社区。厂商放出一个代号,用户就会开始跑 benchmark、接入 Agent、对比输出,甚至研究 tokenizer 和报错信息。HappyHorse、Pony Alpha 到 Ox Alpha,都是同一个过程:模型还没正式发布,社区已经替它完成了一轮能力测试、一轮技术分析和一轮口碑传播。从厂商角度看,这笔账很好算。实验室里的 benchmark 能告诉团队模型「会不会做题」,开发者则会告诉团队模型「能不能干活」。它在真实代码库里会不会卡住,工具调用会不会出错,长上下文拉长以后还记不记得目标,主峰期服务稳不稳定——这些问题,只有真实用户拿品种去撞,才能撞出来。匿名测试还有一个更直接的好处:免费期里留下的使用数据,会帮助厂商判断模型应该卖给谁、该怎么定价、哪些能力值得继续投入。对还在找产品定位的新模型来说,这比提前写好一套发布会话术更有价值。但这场盲测并不完全对等。厂商和平台知道模型是谁、服务跑在哪里、哪些信息会被记录;用户拿到的往往只有一个代号和一段有限的说明。Reddit 上就有开发者提到,匿名模型很难进入严肃的企业评估流程:公司内部的 benchmark、代码和业务数据都涉及合规,等走完审批,模型可能已经下线了。对个人开发者来说,这是一份免费的惊喜;对企业来说,更像一份没有署名、也没有完整说明书的试用品。Ox Alpha 把这个问题放大得更明显。OpenRouter 的页面写明,提示词和输出会由上游提供商保留,但不会用于训练;OpenCode 的相关说明则强调零儿据留存。两种说法并不完全一致。对只是试玩的用户,这可能只是条款差异;对准备上传代码和业务文档的团队来说,它直接决定了能不能接入。还有一个容易被忽略的问题:真实公测测出来的,从来不只是一款模型的能力。研究者 Serafim Batzoglou 在 INDUCTION 基准上测试 Ox Alpha 时,遇到了大量空回答和 API 错误。为了获得 87 个可评估结果,他一共调用了 551 次 API。他的困惑很有代表性:问题究竟出在模型,还是出在 OpenRouter 的接入链路?对最终用户来说,这个问题其实没有那么重要——模型能不能稳定工作,本来就是产品能力的一部分。匿名发布,确实给了模型一个摆脱品牌滤镜的机会,也让厂商能更早看到真实世界的反馈。但厂商拿到真实数据的同时,用户也承担了更多判断成本:要自己猜身份,自己判断能力,自己核对数据政策,还要自己承担服务不稳定的风险。海量资讯、精准解读,尽在新浪财经APP
-
大满贯三连冠!朱珍珍组合夺得美网轮椅女双冠军_体育_央视网(cctv.com)以侨为桥,厚植人文交流沃土(APEC中国年:开放 创新 合作)|暨大|华文|教育|学校|高校|暨南大学_网易订阅Iren首座执行官:AI算力供应可能永远无法满足要求_新浪财经_新浪网数字金融“贷”动湘企出海!兴业银行长沙分行落地首笔“兴速贷”_新浪财经_新浪网半全场分析:奥格斯堡 vs 勒沃库森,谨慎防守平局|萨索罗|勒沃库森队|奥格斯堡队|纽卡斯尔队_网易订阅27张图,全面了解公募REITs_新浪财经_新浪网沙特阿美一处设施遭遇新一轮袭击_新浪财经_新浪网UBS Group AG减持澜起科技(06809)6.35万股 每股作价约293.15港元_新浪财经_新浪网别再过度吹捧!前冠军队友直言:詹姆斯加盟76人只是拼图,绝非核心|老詹|恩比德|76人队|钱宁·弗莱|勒布朗詹姆斯|勒布朗·詹姆斯_网易订阅WTT澳门赛:韩国队全体放弃!专心备战亚运会,国乒多位主力也退出|奥运|乒乓球|顶尖选手|wtt澳门赛_网易订阅
相关内容
- ·斩获数亿元融资,星测未来「扶摇计划」按下太空算力 Token 运营服务加速键|卫星|遥感|token|双向迅速激光_网易订阅
- ·紧急调整!CCTV5直播大变!20点30生死战,中国女篮无路可退|中超|亚冠|世界杯_网易订阅
- ·对话动念引线梁琛奇:非典型字节创业者的 “娱乐至上”|小红书|知名企业|科技从业者_网易订阅
- ·南方东英恒生港股通红利ETF相关指数将更名并更改加权方式 2026年9月14日生效_新浪财经_新浪网
- ·伊姐周六热推:电视剧《生逢其时》;综艺《大哥小助理》......|胡军|李乃文|关晓彤|老戏骨_网易订阅
- ·黄源浩减持奥比中光:套现5亿 肖振中套现过亿 筹备港股上市_新浪财经_新浪网
- ·武大付磊原配发文:她和付磊没有离婚,她知道付磊出轨了,付磊没承认过|小三|妲己_网易订阅
- ·9月7日增减持汇总:国科军工等12股拟减持,森特股份拟增持(表)_新浪财经_新浪网
- ·皇马VS巴列卡诺首发浮现:楚阿梅尼坐镇,贝林厄姆+维尼修斯领衔,姆巴佩冲锋|西甲|皇家马德里|姆巴佩失点|裘德·贝林厄姆|基利安·麦巴比_网易订阅
- ·白露食白——露从今夜白,味从此时鲜|莲藕|山药|龙眼|萝卜|秋天|健康美味_网易订阅
- ·ETF日报:成长风骨回暖的背景下,创业板新能源链条同步修复_新浪财经_新浪网
- ·邻居换了比自家高的防盗门,打算“压自己一头”,网友的支招绝了|楼房|装修|新房子_网易订阅
- ·[流言板]HLE分享选手赛场返图:准备好战斗了🔥-英雄联盟丨LPL-虎扑社区
- ·追梦中华·侨见自贸港:海南发展潜力巨大,前景令人充满期待
- ·石头科技IFA放大招:从地板扫到泳池,世界第一绝非浪得虚名_新浪财经_新浪网
- ·易方达(香港)精选债券:披露2026年9月4日基金份额净值_新浪财经_新浪网
最新内容
- ·足坛疯狂一夜:佛罗伦萨逆袭,马赛耻辱3连败,塞维利亚惊险绝杀|雷恩|巴伦西亚|塞维利亚队|沙尔克04队_网易订阅
- ·福建一小区发通知“禁止新能源汽车停在车库”,新能源车主:买了20年使用权停了不到2年,物业:怕爆炸,615户业主已表决通过_新浪财经_新浪网
- ·福建莆田一零嘴店被淹损失百万,店铺老板:被淹时店里没人,来不及转移,被水泡过的零嘴不能售卖,会全部销毁|排水管|莆田市_网易订阅
- ·AI视频1.2亿播放量月营收仅80元?六连板龙版传媒紧急澄清_新浪财经_新浪网
- ·不到40集就封神!这2部科幻剧凭什么|奇幻|漫画|迷你剧|国产动画电影_网易订阅
- ·又一个“千万地铁城市”,来了_新浪财经_新浪网
- ·讲授“法治第一课” 首座大法官提到这些关键词
- ·国乒最强底牌曝光!不是王楚钦,真正王牌已经另有其人|亚运会|奥运会开幕式_网易订阅
- ·流鼻血时要仰头?别再用这些“急救方法” 严重可能致命
- ·就业超预期施压 ETH,ETF 月入 18.5 亿对冲抛压_新浪财经_新浪网
推荐内容
热点内容
- ·英超前瞻|水晶宫连胜稳了?升班马致命短板藏不住了|曼联|水晶宫队|伊普斯维奇|净胜球优势_网易订阅
- ·3600亿元真金白银,对老百姓带来哪些影响?_新浪财经_新浪网
- ·奥迪发布纯电掀背A2 e-tron,宣称品牌史上最省电_新浪财经_新浪网
- ·昔日“私募一哥”徐翔,最新判决!部分案件改判为由徐翔个人承担赔偿责任_新浪财经_新浪网
- ·周薪100镑到未来6500万镑先生,他让主帅想起梅西|英超|伦敦|里奥梅西|恩迪亚耶|切尔西队|利昂内尔·梅西_网易订阅
- ·任天堂发布会重磅新游消息疑泄露 你最期待哪款?|游戏|时之笛|直面会|塞尔达传说|索尼发布会_网易订阅
- ·如何看待会稽山营收反超?古越龙山总经理马川:希望竞争良性、健康 持开放和积极态度_新浪财经_新浪网
- ·SpaceX竞争对手完成历史性首飞,称行业正 “迫切渴求” 更多火箭运力_新浪财经_新浪网
- ·因莫比莱:弗拉泰西心中有火,皮纳蒙蒂要适应罗马城的压力|拉齐奥|加图索|萨索罗|达维德·弗拉泰西_网易订阅
- ·上下求索6号:侧重日内短线,最大回撤仅10.86%_新浪财经_新浪网
