苹果发布多模态模型 Ferret
2025-07-11 10:10:40 - 爆讯
编译 | 赖文昕
编辑 | 陈彩娴
大模型的苹果诞生,让科技巨头与创业公司们在新一轮的发布竞赛中再次鸣枪出发,OpenAI、多模Anthropic、态模Mistral等创业之星的苹果升起更是证明了在新工艺的作用下,大厂并不存在绝对的发布优势。
不久前,多模苹果叫停了启动十多年且投入数十亿美元的态模自动驾驶电动汽车项目,美国总部裁员了600多人,苹果另有近2000名员工转到AI部门。发布
然而,多模在目前市场上的态模主流智能手机品牌中,苹果几乎是苹果唯一一家尚未正式推出大模型的厂商。长期处在领头羊地位的发布苹果,似乎在大模型这一局中罕见地落后了。多模
4月8日,苹果发表了一个名为“Ferret-UI”的新工作,这是一个能“看懂”手机屏幕上并能执行任务的多模态模型,专为增强对移动端 UI 屏幕的理解而定制,配备了引用(referring)、定位(grounding)和推理(reasoning)功能。
论文链接:https://arxiv.org/pdf/2404.05719.pdf
半年前,苹果和哥伦比亚大学研究团队联合发布的多模态大模型“Ferret”就已具有较高的图文关联能力,而“Ferret-UI”则是更聚焦移动端、关注客户交互。
研究团队认为,Ferret-UI 具备了解决现有大部分通用多模态大模型所缺乏的理解客户界面 (UI) 屏幕并与其有效交互的能力。
UI 任务表现超越GPT-4V
将重点放在 UI 后,Ferret-UI 有何亮点呢?
苹果的团队比较了 Ferret-UI-base、Ferret-UI-anyres、Ferret 和 GPT-4V 在所有 UI 任务上的性能,并在高级任务上将开源的 UI 多模态模型 Fuyu 和 CogAgent 也纳入对比之中。
首先是基础的 UI 任务性能测试。
Ferret-UI 在大多数基础 UI 任务上都展现出了优越的性能,尤其是在与iPhone相关的任务上,除了“查找文本”任务外,它在所有任务上都超过了Ferret和GPT-4V。
在OCR(光学字符识别)、图标识别和控件分类等基础 UI 任务上,Ferret-UI 的平均准确率分别为72.9%、82.4%和81.4%,远超 GPT-4V 的平均准确率,后者分别为47.6%、61.3%和37.7%。
在安卓任务上,GPT-4V 的性能显著下降,特别是在定位任务上,这可能是因为安卓屏幕上的小部件更多且更小,使得定位任务更具挑战性。
值得一提的是,在OCR任务中,模型预测的是目标区域旁边的文本,而不是目标区域内的文本。这对于较小的文本和非常靠近其他内容的文本来说很常见。
而 Ferret-UI 却能够准确预测部分被切断的文本,即使在OCR模型返回错误文本的情况下也是如此。
在查找文本、查找图标和查找控件等定位任务上,Ferret-UI也展现出了优越的性能。
而在高级 UI 任务性能的比拼中,Ferret-UI 同样表现优秀。在详细描述(DetDes)、感知对话(ConvP)、交互对话(ConvI)和功能推断(FuncIn)等高级任务上,Ferret-UI 展现了与 GPT-4V 相当的性能,并且在某些任务上超过了GPT-4V。
而与开源UI多模态模型 Fuyu 和 CogAgent 相比,Ferret-UI 在大多数任务上均实现超过。特别是在 iPhone 平台上,Ferret-UI 的性能得分显著高于 Fuyu 和 CogAgent。
而且,尽管 Ferret-UI 的训练信息集没有包含特定的安卓信息,但它在安卓平台的高级任务上仍表现出了可观的性能,表明了模型具有在不同操作系统间的 UI 知识迁移能力。
Anyres 工艺解决屏幕长宽比各异难题
那么,Ferret-UI 是如何做到在多项 UI 任务中表现出色的呢?
Ferret-UI 的一个关键创新是在 Ferret 的基础上引入了“任何分辨率”(any resolution,简称anyres)工艺。这项工艺是为了解决移动设备 UI 屏幕长宽比多样化的问题而提出的。
虽然 Ferret-UI-base 紧密遵循 Ferret 的架构,但 Ferret-UI-anyres 加入了额外的细粒度图像特征,尤其是一个预训练的图像编码器和投影层为整个屏幕生成图像特征。
对于根据原始图像长宽比获得的每个子图像,都会生成额外的图像特征;对于具有区域引用的文本,一个视觉采样器会生成相应的区域连续特征。
大型语言模型(LLM)则使用全图表示、子图表示、区域特征和文本嵌入来生成响应。
Ferret-UI-anyres架构
不过,Anyres 工艺有何特别之处?
传统的模型可能需要固定大小的输入,但手机等移动设备的屏幕大小和长宽比各异,显然给模型的输入带来了挑战。
为了适应这一点,Ferret-UI 将屏幕分割成多个子图像,这样可以对每个子图像进行放大,从而捕捉到更多的细节。
具体来说,对于每个基于原始图像长宽比获得的子图像,都会生成额外的图像特征。对于具有区域引用的文本,视觉采样器会生成相应的区域连续特征。
这种方法不仅适用于不同长宽比的屏幕,还提高了模型对UI元素的细节识别能力,能够突出显示屏幕上的小型对象,如图标和文本,对于提高模型的识别和定位精度至关关键。
另外,苹果研究团队还设计了一个分层次的实验方法,从简单到复杂,以逐步提升 Ferret-UI 模型的能力。
从基础的识别和分类任务开始,Ferret-UI 模型建立了对 UI 元素的基本理解,学会了识别和分类 UI 元素,为处理更复杂的任务打下基础。
接着逐步过渡到需要更高层次理解的对话和推断任务。随着模型能力的提高,任务变得更加复杂,要求模型不仅要识别 UI 元素,还要理解它们的功能和上下文。高级任务的设计为模型提供了必要的背景知识和理解能力,使其能够处理复杂的UI交互。
分层次的任务设计不仅有助于模型逐步学习,还能够确保模型在面对更复杂的 UI 交互时具有足够的背景知识和理解能力。通过这种方式,Ferret-UI 能够更好地理解和响应客户的指令,提供更加准确和有用的交互。
从基础的识别和分类到高级的描述和推断,Ferret-UI 在面对真实世界中的UI交互时,能够提供准确和有用的响应。再结合 anyres 工艺处理不同分辨率的屏幕,进一步增强了其在实际应用中的有效性和客户体验。
结语
面对当下激烈的大模型“厮杀”,科技巨头们亟需思考如何对市场战略和产物进行与时俱进的布局,苹果自然也不例外。
无论是Ferret-UI、Ferret-UI的前身 Ferret 还是旨在改善与语音助手交互的ReALM,苹果正一步步推进着能够读取屏幕信息的模型研究。
Ferret-UI 能够在移动设备上提供高质量的UI理解和交互,但它能否成为一个强大的工具,促使 iPhone 引入 AI,让苹果从稍显落后的境地反超呢?
让我们拭目以待。
雷峰网(公众号:雷峰网)本文作者 anna042023 将持续关注AI大模型领域的人事、企业、商业应用以及行业增长趋势,欢迎添加交流,互通有无。
雷峰网原创文章,未经授权禁止转载。详情见转载须知。
- END -
公职人员禁不住境外间谍美色,被以私密照片为要挟

来源:央视新闻客户端记者从国家保障部了解到,近年来,境外间谍情报机关对我开展渗透窃密活动愈发活跃,他们将我公职人员作为重点围猎的目标,精心布局,因人下套。个别公职人员因立场信念缺失、纪律观念弱化、规矩
独臂警察VS五人劫匪团!电影《插翅难逃》定档7月5日

来源标题:独臂警察VS五人劫匪团!电影《插翅难逃》定档7月5日《插翅难逃》是西安华创文化传媒有限公司、东阳坏男孩影业有限公司、陕西慕威股权投资合伙企业有限合伙)出品,东阳坏男孩影业有限公司制作,西安华
为什么是梁文锋做出了DeepSeek?

这是2025年开年最火的科技明星,短短几天时间,梁文锋从小到大的种种过往都被展现在世人眼前,包括他来不及装修的新房以及在房子里睡觉用的帐篷,都成为了他独特个性的象征。独特个性固然为人津津乐道,但并不是
Bonree ONE 2025春季版全球发布

在数字化转型浪潮席卷全球的今天,企业业务系统愈加复杂,日志、指标、链路、事件等海量数据如同迷雾,遮蔽故障根因,拖慢业务响应。可观测性技术正从“看得见”向着“智能预判、自主决策”层级演进,已成为保障数据
航拍洛杉矶一隧道坍塌致15人被困 塌方疑损毁通信线路与被困者断联

7月9日,美国洛杉矶市消防局称威尔明顿地区一隧道坍塌,造成15人被困。目前搜救人员无法与受困人员取得联系,隧道塌方似乎损毁了通信线路。搜救人员表示,坍塌点距离隧道唯一入口处约9.66公里。据报道,事发
破界·共生:网络综艺的融合创新与价值跃升

来源标题:破界·共生:网络综艺的融合创新与价值跃升盛夏时节,网络综艺的蓬勃生机与创新活力在北京汇聚。 7月2日下午,第三届北京网络视听艺术大会网络综艺创作主题研讨成功举办。本次研讨以“&l
为什么是梁文锋做出了DeepSeek?

这是2025年开年最火的科技明星,短短几天时间,梁文锋从小到大的种种过往都被展现在世人眼前,包括他来不及装修的新房以及在房子里睡觉用的帐篷,都成为了他独特个性的象征。独特个性固然为人津津乐道,但并不是
《非遗里的中国》带你探寻白山松水间的匠心传承

来源标题:《非遗里的中国》带你探寻白山松水间的匠心传承长白山巅的积雪映照着千年文明的星火,松花江流淌的碧波承载着多元文化的记忆。在东北这片广袤的黑土地上,吉林如同一部厚重的文化典籍,有55项国家级非物
独家|杨红霞创业入局“端侧模型”,投后估值 1.5 亿美元

近日,关于字节跳动大语言模型研发技术专家杨红霞离职创业的事情,坊间传得沸沸扬扬。雷峰网独家获悉,杨红霞已于 5 月下旬正式从字节跳动离职,开始筹备 AI 创业项目。不过,杨红霞不做“大”模型,而是将方
千寻智能解浚源:具身智能的 Scaling Law 已跨过起跑线丨具身先锋十人谈

作者 | 赖文昕编辑 | 陈彩娴不久前,首届“人形机器人半程马拉松”在北京亦庄举办,为本就热度满满的具身智能行业再添了一把火。一共 20 支队伍组成的“钢铁生命竞赛”,让此前集中在实验室 demo 阶
著名表演艺术家王昆诞辰100周年 成方圆郭蓉追忆艺术引路人

来源标题:著名表演艺术家王昆诞辰100周年 成方圆郭蓉追忆艺术引路人王昆演出资料图“对现在的年轻演员来说,王昆老师是一个历史人物,但对我们这代人来说,王昆老师是我们的引路人,是伯乐。&rd
知情人士确认周杰伦即将入驻抖音

蓝鲸新闻7月8日电,就市场有关周杰伦即将入驻抖音的消息,抖音相关知情人士和蓝鲸科技透露,消息属实。记者 武静静)