News brief
正文
阿里云通义实验室今日正式开源Qwen2.5-VL视觉语言模型,提供3B、7B和72B三个参数版本。该模型在视频理解、复杂图表解析及多语言OCR任务上表现优异,以78.5的综合得分登顶HuggingFace Open LLM Leaderboard视觉榜单。72B版本支持动态分辨率输入,并能精准定位长达2小时视频中的关键帧。目前该模型已在GitHub收获超2万Star,极大降低了企业部署多模态AI的门槛。
News brief
阿里云通义实验室今日正式开源Qwen2.5-VL视觉语言模型,提供3B、7B和72B三个参数版本。该模型在视频理解、复杂图表解析及多语言OCR任务上表现优异,以78.5的综合得分登顶HuggingFace Open LLM Leaderboard视觉榜单。72B版本支持动态分辨率输入,并能精准定位长达2小时视频中的关键帧。目前该模型已在GitHub收获超2万Star,极大降低了企业部署多模态AI的门槛。