从 3D 场景到交互游戏。查看真实输出,以及每个作品背后的 prompt 与评分。
试试其他关键词,或清除筛选条件。
这里展示的是 Qwen3-4B-Base 经 VeOmni 训练后,在固定 100 道测评题上的输出,不是 GLM 生成的训练样本。
98 条有有效评分。另 2 条只生成了 3 个 token 后结束,没有 HTML,保留在作品库中,不按零分计算。各题 rubric 的维度与权重可能不同。
1 条评审的返回上限提升至 16,384 token,并对完整返回的字段名做映射;原始逐项判断未改动。截断作品展示的是原测评流程提取的 HTML。