「便宜的那档先说胡话」:Grok Lite 遭遇持续乱码回复

| | 1 次浏览

大模型「翻车」的方式大致有两种:一种是temperature 一本正经地编造事实,另一种是干脆输出谁也读不懂的乱码。前者叫幻觉,后者连幻觉都算不上——它意味着服务本身坏掉了。本周,xAI 的 Grok 就遭遇了后一种尴尬。

出问题的是 Grok Lite

TechCrunch 报道,从周三早上开始,陆续有用户发现 Grok 返回完全无法阅读的乱码回复。受影响用户有一个显眼的共同点:他们使用的都是 Grok Lite——从命名与定位看,这是 xAI 产品线中更轻、更便宜的那一档。截至报道发出,问题仍在持续,乱码还在被「源源不断」地发给用户,公开渠道尚未见到 xAI 给出完整的根因说明。

这类故障对用户的杀伤力很直接:幻觉至少需要一点专业知识才能识破,乱码则一眼可见。用户不需要懂什么是 tokenizer,也能意识到「这个产品现在坏了」。

乱码从哪来

对在推理服务里摸爬滚打的工程师来说,模型突然说胡话并不神秘,常见嫌疑人就那么几个:采样参数在配置变更后被改坏;为了压成本做的激进量化让数值精度出了问题;KV 缓存或上下文拼装错位,把不属于本次请求的 token 混进了回复;又或者一次灰度发布把坏版本推给了部分流量。而 Grok Lite 作为低成本档位,恰恰是最可能同时踩中「量化更狠、迭代更快」这两条线的位置。

当然,在官方复盘出来之前,这些都只是合理猜测。但无论根因是哪一个,它都指向同一个问题:轻量版可以便宜,但不能便宜到把「输出通顺人类语言」这条地板锯穿。

不是第一次,也不会是行业最后一次

对 xAI 来说,输出失控并不是新话题。过去一年多,Grok 已多次因不当言论或行为异常登上新闻,官方曾把原因归结为提示词改动或上游数据污染。这次的不同之处在于,它不是「说了不该说的话」,而是「话都说不利索」——这更接近一次基础设施事故,而非对齐问题。

影响层面有两点值得注意。其一,Lite 这类低价档位往往承接的是 API 侧的大批量调用:批处理、摘要、客服分流这些对单次质量不敏感、对总量敏感的场景。一旦出问题,波及的可能不是几个聊天用户,而是嵌入了 Grok 的第三方产品。其二,在模型路由日益普及的当下——Stripe 收购 OpenRouter、Ramp 推出自家 Router 都是近例——模型的可替换性越来越强,企业对单一模型的忠诚度越来越低。稳定性上的每一次翻车,都会被记进下一次选型的账本里。

简短点评

乱码其实是一种「诚实的故障」:它一眼可见、无法辩解,至少不会像幻觉那样悄无声息地混进报告或代码里。但对用户而言,两种故障的终点是一样的——信任流失。对 xAI 来说,比尽快修复更重要的,是像成熟的基础设施厂商那样发布事后复盘:哪次变更引入了问题、为什么监控没有拦住、未来如何避免。AI 产品竞争走到今天,参数规模和榜单分数的差距在不断缩小,「不隔三差五说胡话」正在成为一项货真价实的竞争力。

评论(0)

暂无评论,来写第一条吧。