讓 AI 直接操作手機,別再為了 AI 助理租雲端伺服器了
2026年有一股 AI 龍蝦熱潮,AI 能回答問題,還能直接執行任務,還有持久的對話記憶機制,根本就是請了一個私人貼身助理,我還跟朋友開玩笑說,以後談事情乾脆讓彼此的龍蝦先聊,人類再出來簽名就好。
但這類新技術看似美好,真要推給身邊一般朋友時,常常講到覺得自己像個瘋子。
有人說他的網路銀行、文件和照片資料都在手機上,
為什麼還要去申請 API,龍蝦才能讀取聊天紀錄、編輯雲端硬碟的文件?
搞了老半天,結果龍蝦還是不能幫忙回覆個人 LINE 訊息嘛。
有人說他手機和平板 24 小時都開著,
為什麼還要花錢去租雲端伺服器?
然後煩惱伺服器資安問題?
還要去買 Mac Mini, 因為可以收發簡訊郵件、轉錄會議語音、跑本地大語言模型。
結果跑得這麼慢,幹嘛不用 ChatGPT?
一些工程師習以為常的操作,對一般人來說,就像只想喝杯牛奶,卻被要求先在後院蓋一座牧場一樣荒謬。
後來市場上也出現其他概念的 AI Agent 商品,
例如 Grok Bot、Perplexity Computer,
廠商直接幫大家組好了「AI 戰隊」,繳錢開帳號就能用,
確實是一種更方便的模式,但還是沒有解決上面所有的問題。
如果 AI 助手直接住在我的手機裡?
前陣子我注意到一款滿有意思的 Android APP……FoneClaw

FoneClaw 的思路是把 AI Agent 直接放到 Android 手機上,
利用使用者授權的手機資訊與系統能力來完成任務,
而不是想用 AI 助理反而把自己搞得越來越忙。
資料都在手機上?
沒問題,在使用者授權後,FoneClaw 可以讀取任務所需的手機資訊。
不想繁瑣申請一堆 API 或被單一模型綁死?
沒問題,FoneClaw 已提供免費預設模型,可以直接使用;

進階使用者也可以自行配置相容的線上模型或本地模型。

想查資料也不用另外開瀏覽器,FoneClaw 可以把網路搜尋納入任務流程,查完資料還可以直接存到指定的 APP 裡面。
連錄音、通知、簡訊、行事曆、備忘錄、裝置設定等,都是 AI Agent 執行任務的一部分。
這個想法就有趣多了,與其等待全世界的 APP 打掉重練變成「AI 可以使用的 APP」,不如直接讓 AI 助手住在手機裡,使用手機原本就能做的事情。
這就是 FoneClaw 想走的路。
FoneClaw:讓 AI Agent 真正動手操作手機
FoneClaw 的核心是打造一套真正的 Android AI Agent,把 Android 系統變成一個可執行的 Agent 環境,讓 AI 聊天機器人「幫忙操作手機」。

從 FoneClaw 公開的工具清單來看,FoneClaw 提供 100+ 項 Android 內建工具,涵蓋螢幕與 App、裝置控制、導航、通訊、行事曆、系統資訊、Web、Workflow 等不同類別。
它的基本使用方式其實很直覺:
- 告訴它你想做什麼:直接用自然語言描述任務,不需要學習什麼 adb 指令。
- 理解目前的手機情境:可以在使用者授權後,取得螢幕、圖片、訊息、錄音、行程與裝置狀態等資訊。
- 執行實際操作:除了回答問題,也能開啟 App、讀取畫面、操作系統設定、建立行事曆、處理通知與訊息等。
- 跨 App 完成任務:例如從聊天內容取得地址,再交給地圖導航,而不需要自己複製、切換 App、貼上。
- 直接使用網路資訊:可以把搜尋與網頁內容納入 Agent 的工作流程。
- 重要操作仍由使用者確認:涉及傳送訊息、修改設定等操作時,可以保留最後的確認步驟,避免 AI 自己做出不可逆的操作。
FoneClaw 把原本散落在手機各個角落的功能,變成 AI 可以理解並串接的工具。
使用案例:從聊天內容直接開啟導航
朋友在 LINE 傳了一個聚餐地址,或是正在查看某間餐廳的 Instagram 社群貼文。
我們常常在很難選取的貼文或對話裡小心翼翼圈選、複製地址,
再離開目前的 App,
打開 Google Maps,
貼上地址,
最後才開始導航。
現在我們直接跟 FoneClaw 說:「幫我導航到螢幕上的這個地址。」
FoneClaw 能直接理解目前螢幕上的內容,取得目的地後開啟地圖路線。
這正是它「理解使用者需求、理解當前手機場景,再把資訊轉化為行動」的智慧概念。
使用案例:一句話調整手機設定
調手機設定這類小事看起來不起眼,卻是日常最常感到煩躁的情境。
現在只要對 FoneClaw 說一聲
「我要去開會了,幫我開啟勿擾模式,並把所有媒體音量靜音。」

「螢幕太亮了,我要看文章,幫我把亮度調低,並開啟護眼模式。」
「我要專心看這份文件,幫我把螢幕鎖定為橫向,螢幕逾時設為 30 分鐘,順便開勿擾。」

不是我不會做,是我不想在控制中心或手機設定翻老半天。自己去切換開關選項。
住在手機的 AI Agent 的價值就在於,使用者不需要知道這些設定究竟藏在哪裡,只需要描述最後想要的狀態即可。
ps.不同品牌的 Android 手機,護眼模式可能叫舒適濾鏡、濾藍光、夜間護眼或其他名稱,需要講對名稱,或是直接把按鈕放到控制中心,大家可以在各種需求中探索跟 AI 合作的最佳方式。
使用案例:把一堆通知整理成真正需要處理的事情
手機通知多到一定程度,很容易演變成「全部已讀,但重要事情一件都沒做」,甚至讀都沒讀。
這時候可以直接要求:
「幫我總結一下今天收到的重要簡訊和通知,如果有提到要繳費或取貨的事情,幫我加入待辦事項。」
甚至不需要自己設定,
也不用每次打一大段話使喚AI,
FoneClaw 已經有一些內建的快捷範本,只要點一下就能執行。

這是從大量資訊中判斷優先順序,找出真正需要使用者採取行動的內容。不是把通知用電腦語音口音唸一遍那種層級的東西。
使用案例:查詢網路資料,直接整理到手機
FoneClaw 不只能操作手機,也能把網路搜尋放進任務裡。
例如:「幫我上網查一下目前台灣蘋果官網 Mac mini 整修品的最新價格,然後把重點規格和價格整理好,直接新增到我的 Google Keep 裡。」

這裡其實就串了好幾個步驟:搜尋網頁 → 取得網頁內容 → 整理資訊 → 寫入指定的 APP
這都靠 FoneClaw 的工具目錄中的網頁爬取檢索,以及操作 APP 的相關工具。
如果是需要長期追蹤的事情,還可以進一步利用排程:
「去檢查蘋果官網的 Mac mini 整修品的最新價格與規格,每天定時檢查,有新的就告訴我。」
這時候 AI 就不只是「回答一次問題」,而是開始接近一個會自己執行工作的助理。
ps.要讓 app 常駐做定時任務,需要開啟 app 背景執行權限,可能會增加電量消耗。
使用案例:看著螢幕上的內容繼續往下做
還有一種很符合 FoneClaw 定位的使用方式,是把「目前正在看的東西」直接交給它。
例如:「讀取目前螢幕上的文章,搜尋官方文件和相關資料,整理重點後存起來。」

這類任務的重點不是某一個單獨功能,而是一整條流程:目前螢幕 → 理解內容 → 搜尋 → 整理 → 執行下一步

這也比較接近我對 AI Agent 的想像,
我說最後想得到什麼結果,剩下的步驟由 AI Agent 自己處理。
不是每做一步就問我
「下一步該怎麼辦?」
「需要我把這個主題延伸成三個^#$%^&&%嗎? 」
結語
經常做軟體 E2E 自動化測試的小夥伴都知道,要讓電腦操作人類使用的介面,根本是一個大坑。
程式眼中的「按一下按鈕」跟人類眼中的「按一下按鈕」,根本不是同一回事。改個位置、按鈕換個工程參數、中間跳出一個非預期的視窗,都可能讓整套自動操作流程直接爆掉。
所以 Computer Use 能力每次有新突破,都很容易被 AI 大廠拿出來當成模型能力的大新聞,這其實也很合理,因為這件事情本來就沒有想像中簡單。
而手機更麻煩。
Android 上有數以萬計的 App,每個 App 都有自己的 UI 介面與操作方式。
要讓 AI 理解:
我現在手機上看到的是什麼?
人類要我幹嘛?
我接下來應該按哪裡?
可能比讓 AI 回答一個高中物理考題還難。
Google 和 Apple 當然也正在往這個方向發展,從 Android 的 Computer Control,到 Apple 的 App Intents Framework,目的都是讓 AI 更容易理解並使用手機上的 App。
現在做得不夠完美?沒關係。
AI 今年做不到,明年就會做到;
明年做不到,後年就會變成標配。
至少這幾年每次 AI 發表會,大概都是這個劇本。
今天我們還在討論 AI 把 LINE 聊天室背景的吉伊卡哇角色當成是按鈕,
過幾年搞不好連「叫外送飲料要開哪個 App」「那個調整文字大小的按鈕在哪裡」都不需要想了。
而 FoneClaw 有趣的地方就在於,它已經把這件事情搬到 Android 手機上。
FoneClaw 現在可以免費使用,並內建免費模型;未來可能會再加入進階付費功能。

它不要求使用者買多好的手機,把整支手機改造成什麼 AI Server。
你本來就有 Android 手機,
FoneClaw 直接利用手機原本就擁有的資訊與能力,
只要使用者能授權,就嘗試把事情做好做完。
現在,我們已經開始看到手機從「人操作 App」,
慢慢變成「人告訴 AI 想要什麼,AI 幫你操作手機」的另一種使用方式。
如果你也想體驗讓 AI 真正幫你操作手機,可以直接到 FoneClaw 官方下載 安裝試用。