BACON: Supercharge Your VLM with Bag-of-Concept Graph to Mitigate Hallucinations

概
BACON
代码

[Yang Z., Feng R., et al. BACON: Supercharge your vlm with bag-of-concept graph to mitigate hallucinations. 2024.]

概

本文提出了一种新的数据格式: BACON (BAg-of-Concept graph).

BACON

BACON 希望将一个图片转换为 \(G = (D, O, R, B)\) 的数据格式:
- \(D\) 为文本描述;
- \(O\) 为图片中的目标实体;
- \(R\) 为实体的关系;
- \(B\) 为实体的 bounding box.

为了构建这个图, 作者利用 GPT-4V 或者 (在本文收集的 BACON dataset 上微调后的) LLaVA-13B 上进行实体和关系的抽取. 通过 In-context learning, GPT-4V 能够给出 \((D, O, R)\), 当然作者说这些是提供模板了的.
接着, bounding box 通过 Grounding DINO 得到. 需要注意的时候, DINO 返回的是同一类实体的 bounding box, 所以可能会有多个, 所以再通过 LLaVA 和 CLIP 进行筛选和过滤 (下图展示的就是 graph grounding 的过程)

代码

posted @ 2024-07-05 10:34 馒头and花卷阅读(24) 评论(0) 编辑收藏举报

努力加载评论中...

刷新页面返回顶部

【推荐】还在用 ECharts 开发大屏？试试这款永久免费的开源 BI 工具！
【推荐】编程新体验，更懂你的AI，立即体验豆包MarsCode编程助手
【推荐】凌霞软件回馈社区，博客园 & 1Panel & Halo 联合会员上线
【推荐】抖音旗下AI助手豆包，你的智能百科全书，全免费不限次数
【推荐】博客园社区专享云产品让利特惠，阿里云新客6.5折上折
【推荐】轻量又高性能的 SSH 工具 IShell：AI 加持，快人一步