紫东太初开源9B多模态模型空间评测领先
紫东太初开源通用多模态大模型ZDTaichu5.0-9B,重点强化物理世界中的空间理解与具身任务能力。官方披露,在九项国际空间理解基准测试中,该模型在10B以下通用模型组取得八项第一,同时没有以牺牲通用能力为代价。
多模态模型要从“看懂图片”走向“理解真实场景”,难点在于目标识别、空间关系、视角转换和行动条件判断必须同时成立。ZDTaichu5.0-9B试图把图文理解、任务规划和空间推理合并到同一9B规模模型中。
演示中,模型控制夹爪完成美工刀收纳:拉开抽屉、放入刀具并关闭抽屉。该过程需要持续判断刀柄位置、抽屉状态和夹爪对齐情况,并根据每一步带来的环境变化调整后续动作。
在通用能力上,模型仍覆盖图文理解、文字识别、数学推理、代码和Agent任务。官方称,其基础能力保持在第一梯队,并能在科研Agent示例中完成阻尼振子解析、Python/SciPy数值计算、结果对照、图表生成和报告输出。
空间测试示例包括目标定位、参照系转换和交互条件判断。比如“从左至右找到第二个银色盒子”,模型需要同时识别颜色、物体类别和排列关系,给出的归一化坐标为(237,226),落在目标区域内。
在三视角空间推理题中,模型需把同一房间不同画面中的窗帘、沙发和柜子对应起来,假设自身移动到绿框窗帘处并面向蓝框沙发后,判断红框柜子的相对方位,最终回答为右前方。
另一类任务要求在最右侧杯子的杯柄方向寻找空闲区域,模型不仅要识别杯子,还要判断杯柄朝向与周围占用情况,输出位置落入正确区域。
完整榜单覆盖空间感知、三维推理、多视角变换和具身交互等维度。在MindCube-tiny一项中,ZDTaichu5.0-9B得分78.27,Gemma4 8B-E4B、Gemini 3 Pro和Grok 4分别为48.8462、70.87和63.56。
通用基准中,ZDTaichu5.0-9B在AI2D图解理解上得91.48,仅次于Gemini 3 Pro;WeMath为75.9,MathVista Mini为84.5,OCRBench为85.5。其训练方案包含预训练、监督微调、高质量退火与GRPO强化学习三阶段数据管线;推理侧引入自适应循环推理,通过熵门控为高不确定Token增加内部计算,并用阻尼更新、双重停止判据、轨迹读出与状态回滚控制稳定性。外部任务循环则持续接收新观测和执行反馈,将单步判断连接成长程操作。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文