北京时间今日凌晨,微软在官网开源了多模态AI Agent基础模型Magma。与传统Agent相比,Magma具备跨数字与物理世界的多模态能力,可自动处理图像、视频、文本等多种数据类型。此外,Magma内置心理预测功能,能够准确推测视频中人物或物体的意图及未来行为,显著提升对时空动态的理解能力。