内容持续更新中
近日,美团 LongCat 团队推出了一个名为 UNO-Bench 的全新基准测试,旨在系统性地评估这些模型在不同模态下的理解能力。这个基准测试涵盖了44种任务类型和5种模态组合,力求全面展现模型的单…