EXPERIMENT / G2 · 2026.09

浏览这次训练的作品.

从 3D 场景到交互游戏。查看真实输出,以及每个作品背后的 prompt 与评分。

100固定测评题
ABOUT THE EXPERIMENT

这一页展示了什么?

这里展示的是 Qwen3-4B-Base 经 VeOmni 训练后,在固定 100 道测评题上的输出,不是 GLM 生成的训练样本。

训练数据
9,971 条 g2 query 与 GLM-5.3 HTML
训练
VeOmni · 两轮 · 508 步
测评集
41 道 3D + 59 道游戏
生成
temperature 0.7 · top_p 0.95 · thinking 开启
评审
Gemini-3.8-Flash · temperature 0
评分依据
逐题 rubric + 保存的截图 + HTML 源码

98 条有有效评分。另 2 条只生成了 3 个 token 后结束,没有 HTML,保留在作品库中,不按零分计算。各题 rubric 的维度与权重可能不同。

1 条评审的返回上限提升至 16,384 token,并对完整返回的字段名做映射;原始逐项判断未改动。截断作品展示的是原测评流程提取的 HTML。