WhatsMyLLM English

它是怎么工作的,准确到什么程度

让语言模型给出几百个随机整数,它给你的不会是随机整数,而是它的习惯:常伸手去拿的数字、刻意避开的数字, 一种改了措辞也不变、跨会话也足够稳定、能把模型区分开的形状。这个页面说明这种方法、本站在它之上加的两样东西, 以及那些实测得到而非一厢情愿的数字。

协议

每道挑战要求给出 292 到 333 个介于 1355 之间的整数,逐个选择, 不用工具,事后也不修补列表。识别工具发出 3 段这样的提示词, 再把回复与 14 个模型的指纹库比对,每个模型由 36 条已记录回复代表。

比对采用 ModelTrace 的方法:每条回复变成一个覆盖 355 个取值的分布,经变换后降低采样噪声与措辞的影响, 再与每个模型的中心打分。指纹库、评分核心和 36 道挑战模板都原样来自 ModelTrace。本站逐字节收录这个核心, 然后在它周围搭建其余部分。

长度比措辞更要紧。292 到 333 个数字的回复,按判定所用的尺度,与其模型的吻合强度中位数为 0.398; 218 到 257 个数字的回复为 0.302,28 次里有 6 次跌破判定的地板。这就是本站每段提示词至少要求 292 个数字的原因。

输入门槛

评分核心是一个闭集分类器:不管给它什么,它都会给库里的模型排序然后挑一个赢家。喂给它一个从 1 数到 300 的列表, 它以 86% 的置信度报出了一个 GPT 模型。所以在任何评分之前,6 条规则先判断输入到底是不是模型的回答。

每条阈值都落在全部 576 条真实已记录回复的极值之外,一旦有阈值越过任何一条真实回复,测试就会失败。 门槛拒绝的是结构,不是随机性:一个均匀随机的列表能通过门槛,因为从结构上它和模型的回答无法区分。拒绝它是判定的工作。

开放集判定

核心给出的置信度是在库内各模型之间分配的份额,所以它对已知模型加起来永远是百分之百。均匀随机输入也能拿到 78% 到 90% 的"概率"中位数。 本站不用这个数字。

判定改为找回核心丢掉的信息:粘贴的回复与胜出模型中心的绝对吻合程度(拟合度),以及该模型领先第二名多少(领先幅度)。 拟合度低于 0.25,说明库里没有模型能解释这些回复,判定会直说。领先幅度达到 0.08 及以上,说明就是这一个模型,会被点名。 介于两者之间时,如果家族层面的把握达到 0.9 或更高,判定会给出家族,并承认分不开家族内部的模型。

阈值在 3120 条证据记录上选定:指纹库自有模型的留出回复、每个模型对着不含它的重建库的打分、均匀随机输入, 以及两个模型经不同于库内渠道采集的回复。

测了什么

指纹库建库所用的 12 种提示环境里,只有 3 种能通过在聊天窗口粘贴来复现; 其余的需要真正的系统字段,或者几千字的前缀。所以本站引用的自身数字是在自身条件下测得的: 来自同一可用环境的三条回复、应用判定、覆盖库内每个模型。

提示词风格轮次模型正确仅到家族无结论模型错误
中文1411300
英文,纯文本1413100
英文,JSON 数组1414000
合计4238400

42 轮里 38 轮指出了正确模型,4 轮只到家族,0 轮指错。 在覆盖全部十二种环境的完整留出集上,判定在 168 轮里 147 轮指出正确模型、0 轮指错。 均匀随机输入在 600 轮里 600 轮得到"无结论",从未匹配到任何模型。

它做不到什么

已收录模型的未收录版本会被报成最接近的兄弟版本。 把 Claude Opus 4.7 从库里移除后,12 轮三回复测试里有 7 轮自信地报出了 Claude Opus 4.8。 相近版本共享指纹,特征空间分不开的东西,任何阈值也分不开。把各模型逐一移除后,168 轮里仍有 16 轮报出了兄弟版本。 每个模型的页面都列出了自己的数字。

只给一条回复时,约每百个随机输入中有一个会越过拟合度地板,并可能被告知属于某个家族。 640 次尝试里它从未被点名为某个模型;给三条回复时,则没有任何一个越过地板。推荐三条回复是有原因的。

渠道无法判定。经编码工具采集的 Claude Sonnet 5 与 Claude Haiku 4.5 回复,对着经 API 采集的库内条目打分: 24 轮三回复测试里 18 轮指出了正确模型,0 轮指错。 指纹跟随模型,这正是从聊天窗口粘出来的回复也能被认出的原因,也是判定无法告诉你回复来自哪个界面的原因。

库里十三个条目是继承的。它们的回复经由 API 中转获得,标签背后的服务端身份从未被独立核实。 在每一项测试里它们的表现都和本项目自采的条目一样;这个提醒关乎来源,不关乎准确度。

致谢

指纹方法、评分核心、挑战模板以及库中十三个指纹来自 xqy2006 的 ModelTrace,MIT 许可,原样使用。单数字基线的思路致谢 hlwy-ai-checker, 本站未以任何形式使用它。其余一切,包括输入门槛、开放集判定和 Claude Fable 5.1 的指纹,都是本项目自己的。