从 3D 场景到交互游戏。查看真实输出,以及每个作品背后的 prompt 与评分。
试试其他关键词,或清除筛选条件。
这里展示的是 Qwen3-4B-Base 经 VeOmni 训练后,在固定 294 道测评题上的输出,不是 GLM 生成的训练样本。
评分格式失败的题目会以更高返回上限补评,完整返回可能仅映射字段名;原始逐项判断不改动。截断作品展示的是原测评流程提取的 HTML。