News brief
正文
Meta AI今日在GitHub开源Llama-3.2-Vision多模态模型,提供7B与13B两个参数版本。该模型采用视觉编码器与语言模型解耦架构,在MMMU与DocVQA榜单上刷新开源纪录。得益于INT4量化优化,13B版本可在消费级GPU上实现每秒35 token的推理速度。项目发布24小时内Star数突破2万,开发者社区已涌现多个移动端适配方案。
News brief
Meta AI今日在GitHub开源Llama-3.2-Vision多模态模型,提供7B与13B两个参数版本。该模型采用视觉编码器与语言模型解耦架构,在MMMU与DocVQA榜单上刷新开源纪录。得益于INT4量化优化,13B版本可在消费级GPU上实现每秒35 token的推理速度。项目发布24小时内Star数突破2万,开发者社区已涌现多个移动端适配方案。