GhostUI: Unveiling Hidden Interactions in Mobile UI - 专知论文

会员服务 ·

0

交互 · 移动用户 · 语言模型 · 移动应用 · 视觉语言模型 ·

GhostUI: Unveiling Hidden Interactions in Mobile UI

翻译：GhostUI：揭示移动用户界面中的隐藏交互

Minkyu Kweon,Seokhyeon Park,Soohyun Lee,You Been Lee,Jeongmin Rhee,Jinwook Seo

from arxiv, Accepted at ACM CHI Conference on Human Factors in Computing Systems (CHI '26)

Modern mobile applications rely on hidden interactions--gestures without visual cues like long presses and swipes--to provide functionality without cluttering interfaces. While experienced users may discover these interactions through prior use or onboarding tutorials, their implicit nature makes them difficult for most users to uncover. Similarly, mobile agents--systems designed to automate tasks on mobile user interfaces, powered by vision language models (VLMs)--struggle to detect veiled interactions or determine actions for completing tasks. To address this challenge, we present GhostUI, a new dataset designed to enable the detection of hidden interactions in mobile applications. GhostUI provides before-and-after screenshots, simplified view hierarchies, gesture metadata, and task descriptions, allowing VLMs to better recognize concealed gestures and anticipate post-interaction states. Quantitative evaluations with VLMs show that models fine-tuned on GhostUI outperform baseline VLMs, particularly in predicting hidden interactions and inferring post-interaction screens, underscoring GhostUI's potential as a foundation for advancing mobile task automation.

翻译：现代移动应用程序依赖隐藏交互（如长按和滑动等无视觉提示的手势）来提供功能，同时避免界面杂乱。虽然经验丰富的用户可能通过先前使用或入门教程发现这些交互，但其隐含特性使得大多数用户难以察觉。同样，由视觉语言模型驱动的移动代理（旨在自动化移动用户界面任务的系统）也难以检测隐蔽交互或确定完成任务所需的操作。为应对这一挑战，我们提出了GhostUI——一个专为检测移动应用中隐藏交互而设计的新数据集。GhostUI提供前后对比截图、简化的视图层级结构、手势元数据及任务描述，使视觉语言模型能更准确地识别隐蔽手势并预测交互后状态。基于视觉语言模型的定量评估表明，在GhostUI上微调的模型显著优于基线视觉语言模型，尤其在预测隐藏交互和推断交互后界面方面表现突出，这印证了GhostUI作为推进移动任务自动化基础资源的潜力。

0

相关内容

综述：面向移动端大语言模型的隐私与安全

综述：面向移动端大语言模型的隐私与安全

专知会员服务

19+阅读 · 2025年9月7日

黑匣子被打开了！能玩的Transformer可视化解释工具，本地运行GPT-2、还可实时推理

黑匣子被打开了！能玩的Transformer可视化解释工具，本地运行GPT-2、还可实时推理

专知会员服务

36+阅读 · 2024年8月11日

AI大模型赋能手机终端，拥抱AI手机新机遇

AI大模型赋能手机终端，拥抱AI手机新机遇

专知会员服务

35+阅读 · 2024年7月4日

《信息技术移动设备增强现实系统技术规范（征求意见稿）》国家标准

《信息技术移动设备增强现实系统技术规范（征求意见稿）》国家标准

专知会员服务

23+阅读 · 2024年6月7日

科研动态| 一句指令帮你操作手机，最新多模态手机助手Mobile-Agent来了！

科研动态| 一句指令帮你操作手机，最新多模态手机助手Mobile-Agent来了！

专知会员服务

35+阅读 · 2024年2月4日

面向虚实融合的人机交互

面向虚实融合的人机交互

专知会员服务

72+阅读 · 2023年6月25日

《视觉Transformer》最新简明综述，概述视觉Transformers 的不同架构设计和训练技巧

《视觉Transformer》最新简明综述，概述视觉Transformers 的不同架构设计和训练技巧

专知会员服务

67+阅读 · 2022年7月8日

【CVPR 2022】MixFormer：跨窗口与维度的特征融合，MixFormer: Mixing Features across Windows and Dimensions

【CVPR 2022】MixFormer：跨窗口与维度的特征融合，MixFormer: Mixing Features across Windows and Dimensions

专知会员服务

15+阅读 · 2022年3月19日

动态手势理解与交互综述

专知会员服务

34+阅读 · 2021年10月11日

【KDD2020-腾讯】基于移动应用程序使用的通用用户嵌入表示

【KDD2020-腾讯】基于移动应用程序使用的通用用户嵌入表示

专知会员服务

23+阅读 · 2020年6月9日

【Tutorial】计算机视觉中的Transformer，98页ppt

【Tutorial】计算机视觉中的Transformer，98页ppt

专知

21+阅读 · 2021年10月25日

用户画像基础

用户画像基础

DataFunTalk

12+阅读 · 2020年8月1日

一张神奇的贴纸，用 NFC 标签配合快捷指令实现场景自动化

一张神奇的贴纸，用 NFC 标签配合快捷指令实现场景自动化

少数派

15+阅读 · 2020年6月8日

NLP+CV《桥接视觉与语言的研究综述》，带你全面了解视觉+语言最新应用和方法

NLP+CV《桥接视觉与语言的研究综述》，带你全面了解视觉+语言最新应用和方法

中国人工智能学会

27+阅读 · 2019年7月24日

FaceNiff工具 - 适用于黑客的Android应用程序

FaceNiff工具 - 适用于黑客的Android应用程序

黑白之道

151+阅读 · 2019年4月7日

AnDOSid - 适用于黑客的Android应用程序

AnDOSid - 适用于黑客的Android应用程序

黑白之道

11+阅读 · 2019年3月14日

ProxyDroid - 适用于黑客的Android应用程序

ProxyDroid - 适用于黑客的Android应用程序

黑白之道

55+阅读 · 2019年3月9日

超像素、语义分割、实例分割、全景分割傻傻分不清？

超像素、语义分割、实例分割、全景分割傻傻分不清？

计算机视觉life

19+阅读 · 2018年11月27日

最新人机对话系统简略综述

最新人机对话系统简略综述

专知

26+阅读 · 2018年3月10日

看完后，别再说自己不懂用户画像了

看完后，别再说自己不懂用户画像了

R语言中文社区

15+阅读 · 2017年8月28日

移动互联网的用户隐私保护研究

国家自然科学基金

2+阅读 · 2017年12月31日

基于移动平台的视频信息隐藏关键技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

面向应用商店的移动智能终端恶意软件检测关键技术研究

国家自然科学基金

1+阅读 · 2015年12月31日

即时通信中的隐蔽通信模型及方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

内容中心移动社交网络高效安全匿名通信机制研究

国家自然科学基金

0+阅读 · 2015年12月31日

即时通讯匿名隐通道系统模型与算法研究

国家自然科学基金

1+阅读 · 2015年12月31日

移动与可穿戴计算中Eyes-Free交互界面研究

国家自然科学基金

0+阅读 · 2014年12月31日

基于深度信息和显著计算的手势交互技术研究及应用

国家自然科学基金

1+阅读 · 2014年12月31日

Android移动终端多语种基础软件组合的安全技术研究

国家自然科学基金

0+阅读 · 2014年12月31日

移动互联网服务及隐私保护的理论与关键技术研究

国家自然科学基金

1+阅读 · 2014年12月31日

Anonymization-Enhanced Privacy Protection for Mobile GUI Agents: Available but Invisible

Arxiv

0+阅读 · 2月14日

FuncDroid: Towards Inter-Functional Flows for Comprehensive Mobile App GUI Testing

Arxiv

0+阅读 · 2月13日

Blind Gods and Broken Screens: Architecting a Secure, Intent-Centric Mobile Agent Operating System

Arxiv

0+阅读 · 2月11日

Privacy-Preserving Covert Communication Using Encrypted Wearable Gesture Recognition

Arxiv

0+阅读 · 2月8日

TouchScribe: Augmenting Non-Visual Hand-Object Interactions with Automated Live Visual Descriptions

Arxiv

0+阅读 · 2月8日

OpenPhone: Mobile Agentic Foundation Models

Arxiv

0+阅读 · 2月7日

HIDAgent: A Toolkit Enabling "Personal Agents" on HID-Compatible Devices

Arxiv

0+阅读 · 1月31日

MobileBench-OL: A Comprehensive Chinese Benchmark for Evaluating Mobile GUI Agents in Real-World Environment

Arxiv

0+阅读 · 1月28日

UI Remix: Supporting UI Design Through Interactive Example Retrieval and Remixing

Arxiv

0+阅读 · 1月26日

PersonalAlign: Hierarchical Implicit Intent Alignment for Personalized GUI Agent with Long-Term User-Centric Records

Arxiv

0+阅读 · 1月14日

VIP会员

文章信息

相关主题

视觉语言模型

最新内容

以色列-美国-伊朗战争中的无人机：关键要点

以色列-美国-伊朗战争中的无人机：关键要点

专知会员服务

1+阅读 · 今天14:04

美以伊战争：首次人工智能战争——军事自主性困境

美以伊战争：首次人工智能战争——军事自主性困境

专知会员服务

1+阅读 · 今天13:54

《Palantir任务保障性软件安全标准（MA-S2）》

《Palantir任务保障性软件安全标准（MA-S2）》

专知会员服务

5+阅读 · 今天13:49

《美海军利用扩展现实增强知识流动研究》300页报告

《美海军利用扩展现实增强知识流动研究》300页报告

专知会员服务

3+阅读 · 今天13:38

基于声学的无人机检测技术综述

基于声学的无人机检测技术综述

专知会员服务

4+阅读 · 今天13:37

《当代混合战争分析框架：俄乌战争经验教训》

《当代混合战争分析框架：俄乌战争经验教训》

专知会员服务

4+阅读 · 今天13:11

生成式AI基础小册子绪论解读：一条数学地基路线，178页pdf

生成式AI基础小册子绪论解读：一条数学地基路线，178页pdf

专知会员服务

10+阅读 · 5月29日

AutoScientists：自组织智能体团队驱动长期科学实验

AutoScientists：自组织智能体团队驱动长期科学实验

专知会员服务

5+阅读 · 5月29日

《阿利·伯克级驱逐舰的战损修理：桌面推演结果》报告

《阿利·伯克级驱逐舰的战损修理：桌面推演结果》报告

专知会员服务

5+阅读 · 5月29日

战略前沿人工智能的再思考（中文）

战略前沿人工智能的再思考（中文）

专知会员服务

7+阅读 · 5月29日

《量化地基防空系统间接效应的博弈论方法》

《量化地基防空系统间接效应的博弈论方法》

专知会员服务

5+阅读 · 5月29日

传感器网络：美国如何探测来自伊朗的导弹与无人机

传感器网络：美国如何探测来自伊朗的导弹与无人机

专知会员服务

6+阅读 · 5月29日

《无人机战争中的经济不对称：伊朗“沙赫德-136”对抗以色列“铁穹”防御系统的案例研究》

《无人机战争中的经济不对称：伊朗“沙赫德-136”对抗以色列“铁穹”防御系统的案例研究》

专知会员服务

8+阅读 · 5月29日

“史诗怒火行动”中美军损失的作战飞机

“史诗怒火行动”中美军损失的作战飞机

专知会员服务

6+阅读 · 5月29日

ICML 2026 | 理解上下文持续学习中的泛化与遗忘

ICML 2026 | 理解上下文持续学习中的泛化与遗忘

专知会员服务

5+阅读 · 5月28日

相关VIP内容

综述：面向移动端大语言模型的隐私与安全

综述：面向移动端大语言模型的隐私与安全

专知会员服务

19+阅读 · 2025年9月7日

黑匣子被打开了！能玩的Transformer可视化解释工具，本地运行GPT-2、还可实时推理

黑匣子被打开了！能玩的Transformer可视化解释工具，本地运行GPT-2、还可实时推理

专知会员服务

36+阅读 · 2024年8月11日

AI大模型赋能手机终端，拥抱AI手机新机遇

AI大模型赋能手机终端，拥抱AI手机新机遇

专知会员服务

35+阅读 · 2024年7月4日

《信息技术移动设备增强现实系统技术规范（征求意见稿）》国家标准

《信息技术移动设备增强现实系统技术规范（征求意见稿）》国家标准

专知会员服务

23+阅读 · 2024年6月7日

科研动态| 一句指令帮你操作手机，最新多模态手机助手Mobile-Agent来了！

科研动态| 一句指令帮你操作手机，最新多模态手机助手Mobile-Agent来了！

专知会员服务

35+阅读 · 2024年2月4日

面向虚实融合的人机交互

面向虚实融合的人机交互

专知会员服务

72+阅读 · 2023年6月25日

《视觉Transformer》最新简明综述，概述视觉Transformers 的不同架构设计和训练技巧

《视觉Transformer》最新简明综述，概述视觉Transformers 的不同架构设计和训练技巧

专知会员服务

67+阅读 · 2022年7月8日

【CVPR 2022】MixFormer：跨窗口与维度的特征融合，MixFormer: Mixing Features across Windows and Dimensions

【CVPR 2022】MixFormer：跨窗口与维度的特征融合，MixFormer: Mixing Features across Windows and Dimensions

专知会员服务

15+阅读 · 2022年3月19日

动态手势理解与交互综述

专知会员服务

34+阅读 · 2021年10月11日

【KDD2020-腾讯】基于移动应用程序使用的通用用户嵌入表示

【KDD2020-腾讯】基于移动应用程序使用的通用用户嵌入表示

专知会员服务

23+阅读 · 2020年6月9日

热门VIP内容

开通专知VIP会员享更多权益服务

美以伊战争：首次人工智能战争——军事自主性困境

《美海军利用扩展现实增强知识流动研究》300页报告

以色列-美国-伊朗战争中的无人机：关键要点

《Palantir任务保障性软件安全标准（MA-S2）》

相关资讯

【Tutorial】计算机视觉中的Transformer，98页ppt

【Tutorial】计算机视觉中的Transformer，98页ppt

专知

21+阅读 · 2021年10月25日

用户画像基础

用户画像基础

DataFunTalk

12+阅读 · 2020年8月1日

一张神奇的贴纸，用 NFC 标签配合快捷指令实现场景自动化

一张神奇的贴纸，用 NFC 标签配合快捷指令实现场景自动化

少数派

15+阅读 · 2020年6月8日

NLP+CV《桥接视觉与语言的研究综述》，带你全面了解视觉+语言最新应用和方法

NLP+CV《桥接视觉与语言的研究综述》，带你全面了解视觉+语言最新应用和方法

中国人工智能学会

27+阅读 · 2019年7月24日

FaceNiff工具 - 适用于黑客的Android应用程序

FaceNiff工具 - 适用于黑客的Android应用程序

黑白之道

151+阅读 · 2019年4月7日

AnDOSid - 适用于黑客的Android应用程序

AnDOSid - 适用于黑客的Android应用程序

黑白之道

11+阅读 · 2019年3月14日

ProxyDroid - 适用于黑客的Android应用程序

ProxyDroid - 适用于黑客的Android应用程序

黑白之道

55+阅读 · 2019年3月9日

超像素、语义分割、实例分割、全景分割傻傻分不清？

超像素、语义分割、实例分割、全景分割傻傻分不清？

计算机视觉life

19+阅读 · 2018年11月27日

最新人机对话系统简略综述

最新人机对话系统简略综述

专知

26+阅读 · 2018年3月10日

看完后，别再说自己不懂用户画像了

看完后，别再说自己不懂用户画像了

R语言中文社区

15+阅读 · 2017年8月28日

相关论文

Anonymization-Enhanced Privacy Protection for Mobile GUI Agents: Available but Invisible

Arxiv

0+阅读 · 2月14日

FuncDroid: Towards Inter-Functional Flows for Comprehensive Mobile App GUI Testing

Arxiv

0+阅读 · 2月13日

Blind Gods and Broken Screens: Architecting a Secure, Intent-Centric Mobile Agent Operating System

Arxiv

0+阅读 · 2月11日

Privacy-Preserving Covert Communication Using Encrypted Wearable Gesture Recognition

Arxiv

0+阅读 · 2月8日

TouchScribe: Augmenting Non-Visual Hand-Object Interactions with Automated Live Visual Descriptions

Arxiv

0+阅读 · 2月8日

OpenPhone: Mobile Agentic Foundation Models

Arxiv

0+阅读 · 2月7日

HIDAgent: A Toolkit Enabling "Personal Agents" on HID-Compatible Devices

Arxiv

0+阅读 · 1月31日

MobileBench-OL: A Comprehensive Chinese Benchmark for Evaluating Mobile GUI Agents in Real-World Environment

Arxiv

0+阅读 · 1月28日

UI Remix: Supporting UI Design Through Interactive Example Retrieval and Remixing

Arxiv

0+阅读 · 1月26日

PersonalAlign: Hierarchical Implicit Intent Alignment for Personalized GUI Agent with Long-Term User-Centric Records

Arxiv

0+阅读 · 1月14日

相关基金

移动互联网的用户隐私保护研究

国家自然科学基金

2+阅读 · 2017年12月31日

基于移动平台的视频信息隐藏关键技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

面向应用商店的移动智能终端恶意软件检测关键技术研究

国家自然科学基金

1+阅读 · 2015年12月31日

即时通信中的隐蔽通信模型及方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

内容中心移动社交网络高效安全匿名通信机制研究

国家自然科学基金

0+阅读 · 2015年12月31日

即时通讯匿名隐通道系统模型与算法研究

国家自然科学基金

1+阅读 · 2015年12月31日

移动与可穿戴计算中Eyes-Free交互界面研究

国家自然科学基金

0+阅读 · 2014年12月31日

基于深度信息和显著计算的手势交互技术研究及应用

国家自然科学基金

1+阅读 · 2014年12月31日

Android移动终端多语种基础软件组合的安全技术研究

国家自然科学基金

0+阅读 · 2014年12月31日

移动互联网服务及隐私保护的理论与关键技术研究

国家自然科学基金

1+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员