融合ChatGPT+DALL·E 3，贾佳亚团队新作开源畅玩：识图推理生图一站解决（贾佳简历）

原标题：融合ChatGPT

+DALL·E 3，贾佳亚团队新作开源畅玩：识图推理生图一站解决

文章来源：量子位

内容字数：5415字

允中发自凹非寺量子位 | 公众号 QbitAI在开源社区中把GPT-4

+Dall·E 3能⼒整合起来的模型该有多强？

香港中文大学终身教授贾佳亚团队提出多模态模型Mini-Gemini：

更高清图像的精确理解、更高质量的训练数据、更强的图像解析推理能力，还能结合图像推理和生成，堪称王炸。

Mini-Gemini还提供了2B小杯到34B的超大杯，最强模型在多个指标上相比谷歌的Gemini Pro甚至GPT-4V都不遑多让。

目前，Mini-Gemini从代码、模型到数据已全部开源，登上了PaperWithCode热榜。

Mini-Gemini线上Demo也已发布，超会玩梗，一起来体验下！

接近商业闭源模型水平Mini-Gemini Demo放出后受到广大网友关注，一番“品尝”后，他们认为Mini-Gemini跟商业模型差不了多少。

目前，绝大多数多模态模型仅支持低分辨率图像输入和文字输出，而在实际场景中，许多任务都需要对高清图像进行解析，并用图像的形式进行展现。

如下图所示，Mini-Gemini不仅能够根据图片对做面包的过程进行手把手教学，也能够准确将不同电脑品种根据图片中的各种参

原文链接：融合ChatGPT+DALL·E 3，贾佳亚团队新作开源畅玩：识图推理生图一站解决

文章来源：量子位

作者微信：QbitAI

作者简介：追踪人工智能新趋势，关注科技行业新突破