模型 · GPT
GPT-6 Luna
被要求给出几百个随机整数时,GPT-6 Luna 并不会均匀地挑。这个页面就是那种偏好的形状: 它来自 36 条已记录的回复、共 11139 个数字,也是识别工具用来比对粘贴回复的依据。
- 库内 id
gpt-6-luna- 家族
- GPT
- 采集渠道
- API
- 采集日期
- 2026-09-22
- 状态
- 继承自 ModelTrace;服务端身份未经独立核实
- 用到的不同数值
- 355 / 355
- 提示环境
- 12 / 12
能力与价格
- 提供方
- OpenAI
- 智力指数
- 37 · v4.3.2,评测配置为 max
- 指数排名
- 第 9 名,共 11 个
- 输入,每百万 token
- 0.10
- 输出,每百万 token
- 0.50
- 混合价,每百万 token
- 0.20
- 价格排名
- 第 1 名,共 11 个
- 上下文窗口
- 1,000,000 token
分布
每根柱子对应 1 到 355 中的一个值,高度是该模型在全部已记录回复里选中它的次数。 一个真正随机的选择器会给出一条平线。库里没有任何模型是这样的。
偏爱的数字
| 数字 | 被选次数 | 占比 |
|---|---|---|
| 319 | 60 | 0.54% |
| 5 | 57 | 0.51% |
| 18 | 53 | 0.48% |
| 11 | 52 | 0.47% |
| 12 | 52 | 0.47% |
| 6 | 49 | 0.44% |
| 350 | 49 | 0.44% |
| 16 | 48 | 0.43% |
| 31 | 48 | 0.43% |
| 8 | 47 | 0.42% |
| 9 | 47 | 0.42% |
| 73 | 47 | 0.42% |
被认出的可靠度
在覆盖全部十二种提示环境的留出测试中,12 轮三回复测试里有 8 轮以明显区分度指出了这个模型,1 轮是家族内的接近情形,3 轮只有较弱的匹配,0 轮以明显区分度指向了别的模型。
把这个模型从库中移除、再用它自己的回复去比对其余模型时,12 轮里仍有 0 轮以明显区分度指向了另一个模型,2 轮是家族内的接近情形,10 轮只有较弱的匹配。它的回复最常落在 GPT-5.6 Luna(12 轮中的 9 轮)。如果你测的是一个未收录的版本,这就是该记住的数字。
直接采用上游 ModelTrace 55a2e4a 发布的数据,我们没有自行采集回复或留出回复。在上游 36 条回复上交叉验证(不是留出测试),单回复 top-1:GPT-6 Sol 为 33/36,GPT-6 Luna 与 Claude Opus 5.5 为 36/36;三条回复时三者均为 12/12。v2026.09.5 由 Owner 决定收入,尽管入库第 3 条规则在 1,512 个移除模型案例上从 131 变为 132;全部变化见更新日志。
两项测量统计的是本站附在排名第一模型上的状态,而不只是原始排序本身。 原理页说明了测量方法以及它没有覆盖的部分。