Bailian Token Plan · 2026-07-30

以 Qwen3.8-Max-Preview 为 GT 的框定位对比

GT:Token Plan qwen3.8-max-preview(仅思考模式)。对比:百炼主站 qwen3.6-27b / qwen3.6-35b-a3b / qwen3-vl-8b-instruct。 评测集有效主体 318 张(已剔除 empty/transition)。

有效主体 n=318 已剔除 empty/transition 绿=GT · 橙=对比
27B · mean IoU
0.975
median 0.983 · IoU@0.5 = 100%
35B-A3B · mean IoU
0.975
median 0.983 · IoU@0.5 = 99.4%
VL-8B · mean IoU
0.948
median 0.967 · IoU@0.5 = 98.1%
相对 3.8 Max GT:27B 与 35B-A3B 持平(0.975);8B 低约 2.7 个点,短板主要在水母等多部件物体。

1. 总体指标

model n mean median IoU@0.5 IoU@0.75 IoU@0.90
qwen3.6-27b 3180.9750.983 100%98.7%97.8%
qwen3.6-35b-a3b 3180.9750.983 99.4%99.1%98.7%
qwen3-vl-8b-instruct 3180.9480.967 98.1%97.2%94.3%

2. 评测范围说明

3. 分组 mean IoU

group27b35b8b

4. GT / 难例图

绿 = 3.8 Max GT 橙 = 对比模型

5. 推理成本(硅基流动 · 640×480)

model 输入 ¥/K 输出 ¥/K 百张 predict 相对 35B
qwen3-vl-8b-instruct 0.00050.0020 ¥0.0390.24×
qwen3.6-35b-a3b 0.00180.0108 ¥0.165
qwen3.6-27b 0.00300.0180 ¥0.2741.67×

实测约 512 prompt + 67 completion / 张。318 张测试集约:8B ¥0.12 / 35B ¥0.52 / 27B ¥0.87。 完整说明见主报告 index.html §成本

6. POC 结论与选型建议

结论

  • Few-shot「描述卡 + VLM grounding」在桌面/手持物体上可用,相对 3.8 Max GT 的 mean IoU ≈ 0.95–0.98。
  • 27B ≈ 35B-A3B(0.975)> 8B(0.948)
  • 同等 token 下成本:8B ≪ 35B < 27B(百张约 ¥0.039 / ¥0.165 / ¥0.274)。
  • 8B 大体可用,短板在水母等多部件(分组 mean ≈ 0.855)。
  • 空景/转场应在产品侧过滤,不要进 train / 主评测。

选型建议

  • 默认上线:优先 qwen3.6-35b-a3b(与 27B 精度持平、单价更低)。
  • 成本敏感:qwen3-vl-8b-instruct 主推(约 35B 的 1/4),难例级联升 35B。
  • 一般不选 27B 作主路径:精度无增益,百张贵约 1.67×。
  • GT 抽检:用更强闭源(如 3.8 Max)抽样,勿用同系小模型互标当「对人精度」。
  • 工程:生产以 /predict/batch 为主;few-shot 建议 2–4 张。
一句话:要稳用 35B;要省用 8B + 难例升档;27B 性价比最差。

数据:test_outputs/0730_tokenplan_38_gt_compare/ · Few-shot 流程汇报:index.html