开云体育(中国)官方网站以及意会进程中出现幻觉两大痛点-开云「中国」kaiyun体育网址登录入口

LIRA团队 投稿量子位 | 公众号 QbitAI
大模子需要干的活,依然从领先的文生图,推广到了像素级任务(图像分割)。
不外,岂论是OMG-LLaVA,照旧暴戾了embedding-as-mask范式的LISA(CVPR 2024),都还存在分割收场不够精准,以及意会进程中出现幻觉两大痛点。
这主要源于现存模子在物体属性意会上的不及,以及细粒度感知智商的局限。
为缓解上述问题,华中科技大学团队和金山办公团队集结暴戾了两个中枢模块:
语义增强特征索求器(SEFE)和交错局部视觉耦合(ILVC)。
前者交融语义特征与像素级特征,晋升物体属性推贤达商,从而赢得更精准的分割收场。
后者基于分割掩码索求局部特征后,自回来生成局部形色,为模子提供细粒度监督,从而灵验减少意会幻觉。
最终,商议团队构建了在分割和意会两项任务上均取得SOTA的多模态大模子LIRA

与InternVL2比较,LIRA在保握意会性能的同期,异常守旧图像分割任务;与OMG-LLaVA比较,LIRA在图像分割任务上平均晋升8.5%,在MMBench上晋升33.2%。
当今,LIRA相貌已被ICCV 2025请托。
现存形势仍每每无法准确分割办法
通过将分割模块和多模态大模子消失,多模态大模子的智商已从视觉意会拓展至像素级分割
LISA(CVPR 2024)初度暴戾“embedding-as-mask”范式,通过引入 token解锁了分割智商。
OMG-LLaVA 则采用通用分割模子行为视觉编码器,并将图像特征与感知先验交融,从而在分割与理撤职务上终了更优的协同发达。
尽管现存形势已取得显贵进展,但在复杂场景下仍每每无法准确分割办法
下图Figure 2中,OMG-LLaVA就未能正确分割出“最围聚白色汽车的红色公交车”。

为探究分割罅隙的原因,商议团队索求了多模态大模子在第一列图像上生成的token embedding,并径直用于第二列和第三列图像的分割。
道理的是,在 (1) 行的总共图像中,左侧公交车长久被分割出来,这标明 token可能包含了与原图像无关的语义信息。
进一步分析token的logits发现,与“left”相干的值显贵偏高,从而导致左侧公交车被分割出来。
商议团队估计,产陌生割罅隙的原因是多模态大模子在token中未能灵验编码准确的位置信息,反应其视觉意会智商存在局限。
此外,现存形势频繁依赖位置查询来教悔办法位置,但并不可在局部形色与对应图像区域特征之间建筑明确相干,从而可能激勉幻觉。
这引出了一个选藏问题:
是否应径直将局部图像特征输入文本大模子,让模子基于该区域生成形色,从而在视觉特征与语义之间建筑更明确的映射?
同期守旧意会和分割任务的多模态大模子LIRA
遵奉这个想路,商议团队暴戾了同期守旧意会和分割任务的多模态大模子LIRA。
如底下Figure 2所示,商议团队进一步分析了token的logits。
收场标明,当“right”对应的logits更高时右边的bus被分割出,“left”对应的logits更高时,左边的bus被分割出,这可能标明 token执行上包含了被分割物体丰富的语义信息。
LIRA省略准确地将诸如“离白色汽车最近的红色巴士”等查询讲授为指向“右边的巴士”,从而终了精准分割。
这个进程触及把柄用户query和图像信息来意会物体属性,以终了准确的分割,商议团队称之为“Inferring Segmentation”。
这一界说可能与LISA Reasoning Segmentation中所使用的界说有所不同,后者依赖于外部寰球知识或学问来对隐式查询(举例,“请分割图中富含维生素C的食品”)进行推理。

此外,商议者还暴戾了语义增强特征索求器(SEFE)和交错局部视觉耦合机制(ILVC),旨在晋升多模态大模子分割精度和善解意会幻觉。
SEFE通过交融高层语义信息与细粒度像素特征,增强模子的属性意会智商从而提高分割性能。
ILVC通过显式绑定局部图像区域与对应文本形色,为多模态大模子提供更细粒度的监督,从而缓解幻觉状态。

该模块交融了来自预检会多模态大模子的语义编码器和分割模子的像素编码器。
给定全局图像,语义编码器和像素编码器分袂索求特征,经过多层感知机(MLP)休养为换取维度的特征:

随后,应用多头交叉把稳力交融语义特征和像素特征:

最终将交融后的特征拼接为全局特征后送入LLM中:

在多模态大模子中,将局部特征与对应的局部形色对皆关于精准意会办法至关选藏。
但是现存的形势(Figure 4(a))频繁仅索求 token处的embedding,将其输入解码器生要素割掩码。
这种形势并未明确地将局部图像区域与其对应的文本形色径直关联。
受到东谈主类的感知频繁是先怜惜感意思的区域,再进行形色的启发,本文暴戾了交错局部视觉耦合模块匡助将局部图像区域与对应的文本形色进行耦合(Figure 4(b))。

具体而言,LIRA使用token生要素割掩码,基于该掩码从原始图像中编订出对应区域,并将编订区域调整为448 x 448大小后输入SEFE索求局部特征。
随后,将编码后的局部特征再行输入文本大模子,以生成该图像区域的形色并量度后续内容。
通过这种交错的检会范式,ILVC模块到手建筑了局部图像区域与文本形色的显式相干,为局部图像特援引入了细粒度监督,从而缓解了幻觉。
实验收场:优于先前最好形势
实验收场标明,LIRA省略同期守旧意会和分割任务,何况在多个意会和分割数据集上取得了可以的性能。

为考据SEFE的灵验性本文基于InternLM2-1.8B和InternLM2.5-7B主干麇集进行了消融实验。
收场裸露,采用InternLM2-1.8B时,整合SEFE在理撤职务上平均晋升5.7%,分割任务晋升3.8%。
采用InternLM2.5-7B时,理撤职务和分割任务的平均晋升分袂为5.1%和3.4%。

在SEFE的基础上,本文进一步考据整合ILVC的收场。
收场标明,采用ILVC后,在数据集ChairS上,1.8B和7B界限的模子幻觉率分袂裁减了3.0%和4.8%。

将LIRA同期宅心会数据和分割数据进行集结检会,性能仅较单独宅心会数据检会稍许下落0.2%,优于先前最好形势OMG-LLaVA在五个意会数据集上近15%的性能下落。

综上,丰富的实验收场考据了LIRA在多个意会与分割基准上的优异发达。
此外,商议团队还在论文中探究了token在分割任务中的作用,发现其logits省略准确反应被分割物体的属性,估计其可能蕴含更丰富的物体语义信息。
明天商议中,深切探索文本与视觉token之间的关联,可能为晋升多模态大模子的意会和分割智商带来新的启发。
总体而言,LIRA终昭彰意会与分割任务性能的协同晋升,暴戾了在细粒度多模态大模子中缓解幻觉的新视角,并将分割多模态大模子中token的语义内涵纳入商议视线,可能为后续相干探索提供了启示。
arXiv:https://arxiv.org/abs/2507.06272
GitHub:https://github.com/echo840/LIRA
- 上一篇:欧洲杯体育基恩才意志到我方和卡拉格撞衫了-开云「中国」kaiyun体育网址登录入口
- 下一篇:没有了

