广州明生医药有限公司


智谱 AI 开源视觉语言模型 CogAgent 支持GUI图形界面问答

科技资讯 智谱 AI 开源视觉语言模型 CogAgent 支持GUI图形界面问答,明生医药, 健康产品, 医药公司, 中草药疗法, 保健品, 医药研发 12-21

站长之家(ChinaZ.com)12月21日 消息:智谱 AI 开源了 CogAgent,它是一个视觉语言模型,拥有180亿参数规模。该模型在 GUI 理解和导航方面表现出色,在多个基准测试上取得了 SOTA 的通用性能。

它还支持高分辨率的视觉输入和对话问答,并且可以针对任意 GUI 截图进行问答。

模型可以通过上传截图来进行任务推理,并返回计划、下一个动作以及具体操作的坐标信息。

CogAgent 还支持 OCR 相关任务,通过预训练和微调,其能力得到了显著提升。

Github:

https://github.com/CogNLP/CogAGENT

cogagent-chat:

https://modelscope.cn/models/ZhipuAI/cogagent-chat/summary

cogagent-vqa:

https://www.modelscope.cn/models/ZhipuAI/cogagent-vqa/summary


编辑:广州明生医药有限公司

标签:模型,截图,问答,视觉,多个,之家,它是,可以通过,基准,它还