众力资讯网

Apertus 1.5来了,多模态先看清输入与输出Apertus 1.5这两天上

Apertus 1.5来了,多模态先看清输入与输出Apertus 1.5这两天上线了8B和70B版本。它最醒目的变化是多模态:可以接收文字、图像和音频,也加入了可选的thinking mode,标称上下文最高达到262,144 tokens。但看多模态模型,我建议先问四个问题。第一,输入是什么?Apertus 1.5可以接收文字、图像和音频。原生视频输入目前不支持,应用可以先抽帧,再把图片交给模型。第二,输出是什么?当前输出仍是文字。它能理解图片和音频,不等于能直接生成图片、音频或视频。第三,开放到哪一层?项目方强调开放权重、开放数据、开放价值和训练细节。不过下载文件前仍需接受许可证与使用政策,并分享联系信息。第四,今天是否开箱即用?模型卡写明,上游Transformers和vLLM接入仍在推进。现阶段主要依赖项目分支或官方容器,不能简单理解成所有本地工具已经直接支持。所以这次更新真正值得看的,不只是“能听能看”,而是开放模型开始把输入、输出、训练和合规边界写得更完整。以上是基于官方模型卡的编辑解读,本次没有本地部署,也没有复现性能指标。你更看重开放模型的多模态、长上下文,还是可审计训练信息?人工智能开源模型多模态AIAI工具