Bailian Token Plan · 2026-07-30
以 Qwen3.8-Max-Preview 为 GT 的框定位对比
GT:Token Plan qwen3.8-max-preview(仅思考模式)。对比:百炼主站
qwen3.6-27b / qwen3.6-35b-a3b / qwen3-vl-8b-instruct。
评测集有效主体 318 张(已剔除 empty/transition)。
有效主体 n=318
已剔除 empty/transition
绿=GT · 橙=对比
27B · mean IoU
0.975
median 0.983 · IoU@0.5 = 100%
35B-A3B · mean IoU
0.975
median 0.983 · IoU@0.5 = 99.4%
VL-8B · mean IoU
0.948
median 0.967 · IoU@0.5 = 98.1%
相对 3.8 Max GT:27B 与 35B-A3B 持平(0.975);8B 低约 2.7 个点,短板主要在水母等多部件物体。
1. 总体指标
| model | n | mean | median | IoU@0.5 | IoU@0.75 | IoU@0.90 |
|---|---|---|---|---|---|---|
qwen3.6-27b |
318 | 0.975 | 0.983 | 100% | 98.7% | 97.8% |
qwen3.6-35b-a3b |
318 | 0.975 | 0.983 | 99.4% | 99.1% | 98.7% |
qwen3-vl-8b-instruct |
318 | 0.948 | 0.967 | 98.1% | 97.2% | 94.3% |
2. 评测范围说明
- 主指标只统计 10 类有效主体共 318 张(组内有稳定物体的帧)。
- empty(如 36–38):纯色空景,无主体,不进主指标。
- 边缘/转场(如 72–73、109–114):几乎无主体或转场乱入,已剔除。
036 空景 · 已剔除
072 墙面边缘 · 已剔除
3. 分组 mean IoU
| group | 27b | 35b | 8b |
|---|
4. GT / 难例图
绿 = 3.8 Max GT
橙 = 对比模型
5. 推理成本(硅基流动 · 640×480)
| model | 输入 ¥/K | 输出 ¥/K | 百张 predict | 相对 35B |
|---|---|---|---|---|
qwen3-vl-8b-instruct |
0.0005 | 0.0020 | ¥0.039 | 0.24× |
qwen3.6-35b-a3b |
0.0018 | 0.0108 | ¥0.165 | 1× |
qwen3.6-27b |
0.0030 | 0.0180 | ¥0.274 | 1.67× |
实测约 512 prompt + 67 completion / 张。318 张测试集约:8B ¥0.12 / 35B ¥0.52 / 27B ¥0.87。 完整说明见主报告 index.html §成本。
6. POC 结论与选型建议
结论
- Few-shot「描述卡 + VLM grounding」在桌面/手持物体上可用,相对 3.8 Max GT 的 mean IoU ≈ 0.95–0.98。
- 27B ≈ 35B-A3B(0.975)> 8B(0.948)。
- 同等 token 下成本:8B ≪ 35B < 27B(百张约 ¥0.039 / ¥0.165 / ¥0.274)。
- 8B 大体可用,短板在水母等多部件(分组 mean ≈ 0.855)。
- 空景/转场应在产品侧过滤,不要进 train / 主评测。
选型建议
- 默认上线:优先
qwen3.6-35b-a3b(与 27B 精度持平、单价更低)。 - 成本敏感:
qwen3-vl-8b-instruct主推(约 35B 的 1/4),难例级联升 35B。 - 一般不选 27B 作主路径:精度无增益,百张贵约 1.67×。
- GT 抽检:用更强闭源(如 3.8 Max)抽样,勿用同系小模型互标当「对人精度」。
- 工程:生产以
/predict/batch为主;few-shot 建议 2–4 张。
一句话:要稳用 35B;要省用 8B + 难例升档;27B 性价比最差。
数据:test_outputs/0730_tokenplan_38_gt_compare/ ·
Few-shot 流程汇报:index.html