品玩5月17日讯,谷歌近日宣布,推出了一款名为PaliGemma的开源视觉语言模型,该模型结合了图像处理和语言理解的能力,旨在支持多种视觉语言任务,如图像和短视频字幕生成、视觉问答、图像文本理解、物体检测、文件图表解读以及图像分割等。
据悉,PaliGemma能够处理多种视觉语言相关的任务,提供广泛的应用场景。该模型包含30亿(3B)个参数,是一个大型的多模态模型。PaliGemma结合了SigLiP视觉编码器和Gemma语言模型,分别负责处理图像和文本输入。
PaliGemma的发布是谷歌在AI领域的又一项重要贡献,它不仅推动了视觉语言理解技术的发展,也为研究人员和开发者提供了强大的工具,以探索和创造新的应用。开源的特性意味着PaliGemma可以被社区广泛地使用、改进和集成到各种产品和服务中。

0 条评论
请「登录」后评论