BACON: Supercharge Your VLM with Bag-of-Concept Graph to Mitigate Hallucinations

[Yang Z., Feng R., et al. BACON: Supercharge your vlm with bag-of-concept graph to mitigate hallucinations. 2024.]

本文提出了一种新的数据格式: BACON (BAg-of-Concept graph).

BACON

  • BACON 希望将一个图片转换为 G=(D,O,R,B) 的数据格式:
    • D 为文本描述;
    • O 为图片中的目标实体;
    • R 为实体的关系;
    • B 为实体的 bounding box.

  • 为了构建这个图, 作者利用 GPT-4V 或者 (在本文收集的 BACON dataset 上微调后的) LLaVA-13B 上进行实体和关系的抽取. 通过 In-context learning, GPT-4V 能够给出 (D,O,R), 当然作者说这些是提供模板了的.

  • 接着, bounding box 通过 Grounding DINO 得到. 需要注意的时候, DINO 返回的是同一类实体的 bounding box, 所以可能会有多个, 所以再通过 LLaVA 和 CLIP 进行筛选和过滤 (下图展示的就是 graph grounding 的过程)

代码

[official]

posted @   馒头and花卷  阅读(26)  评论(0编辑  收藏  举报
相关博文:
阅读排行:
· Manus重磅发布:全球首款通用AI代理技术深度解析与实战指南
· 被坑几百块钱后,我竟然真的恢复了删除的微信聊天记录!
· 没有Manus邀请码?试试免邀请码的MGX或者开源的OpenManus吧
· 园子的第一款AI主题卫衣上架——"HELLO! HOW CAN I ASSIST YOU TODAY
· 【自荐】一款简洁、开源的在线白板工具 Drawnix
点击右上角即可分享
微信分享提示