融合ChatGPT+DALL·E 3,贾佳亚团队新作开源畅玩:识图推理生图一站解决(贾佳 简历)

AIGC动态欢迎阅读

原标题:融合ChatGPT

+DALL·E 3,贾佳亚团队新作开源畅玩:识图推理生图一站解决

关键字:模型,图像,数据,图片,能力

文章来源:量子位

内容字数:5415字

内容摘要:

允中 发自 凹非寺量子位 | 公众号 QbitAI在开源社区中把GPT-4

+Dall·E 3能⼒整合起来的模型该有多强?

香港中文大学终身教授贾佳亚团队提出多模态模型Mini-Gemini:

更高清图像的精确理解、更高质量的训练数据、更强的图像解析推理能力,还能结合图像推理和生成,堪称王炸。

Mini-Gemini还提供了2B小杯到34B的超大杯,最强模型在多个指标上相比谷歌的Gemini Pro甚至GPT-4V都不遑多让。

目前,Mini-Gemini从代码、模型到数据已全部开源,登上了PaperWithCode热榜。

Mini-Gemini线上Demo也已发布,超会玩梗,一起来体验下!

接近商业闭源模型水平Mini-Gemini Demo放出后受到广大网友关注,一番“品尝”后,他们认为Mini-Gemini跟商业模型差不了多少。

目前,绝大多数多模态模型仅支持低分辨率图像输入和文字输出,而在实际场景中,许多任务都需要对高清图像进行解析,并用图像的形式进行展现。

如下图所示,Mini-Gemini不仅能够根据图片对做面包的过程进行手把手教学,也能够准确将不同电脑品种根据图片中的各种参

原文链接:融合ChatGPT+DALL·E 3,贾佳亚团队新作开源畅玩:识图推理生图一站解决

联系作者

文章来源:量子位

作者微信:QbitAI

作者简介:追踪人工智能新趋势,关注科技行业新突破

0
分享到:
没有账号? 忘记密码?