文章来源:08AI导航发布时间:2025-07-10 14:35:07
据 Arxiv 页面显示,微软近日联手加州大学等高校,共同发布一款多模态大模型产品 MM-Navigator。
MM-Navigator基于 GPT-4V打造,可用于零镜头智能手机 GUI 导航任务。通过使用 MM-Navigator,智能手机屏幕可以像人类用户一样进行交互,并确定后续行动以完成给定的指示。
研究发现,多模态大模型在零镜头 GUI 导航方面表现出色,尤其是 GPT-4V,它具有先进的屏幕解释、行动推理和精确行动定位能力。
相关攻略 更多
最新资讯 更多
2025年了,AI还看不懂时钟,90%人都能答对,顶尖AI全军覆没
更新时间:2025-10-14
光刻机龙头或领投“欧洲OpenAI”
更新时间:2025-10-14
华人缔造商业传奇,全球第一家突破百亿美金的AI编程企业诞生
更新时间:2025-10-14
具身智能进家干活,先从“AI家电”抓起?
更新时间:2025-10-14
前零一万物联创戴宗宏创业:20人团队,能干上百人的AI定制项目
更新时间:2025-10-14
阿里端出最强语音模型,英文rap精准转文字,准确率干翻全球
更新时间:2025-10-14
小扎「梦之队」首批论文上线,LLM自举进化,单步性能狂飙22%
更新时间:2025-10-14
再也不怕面瘫脸,YouTube黑科技:AI帮你「永久微笑」,连僵尸都咧嘴笑
更新时间:2025-10-14
2025年全球企业级AI Agent优秀厂商有哪些?
更新时间:2025-10-14
GPT-5 为啥不 “胡说” 了?OpenAI 新论文讲透了
更新时间:2025-10-14