
如何三分鐘讓 AI 替你操作瀏覽器browser-use 瀏覽器自動化實操指南【免費下載鏈接】browser-use Make websites accessible for AI agents. Automate tasks online with ease.項目地址: https://gitcode.com/GitHub_Trending/br/browser-usebrowser-use 是一個開源的瀏覽器自動化框架你用一句自然語言描述任務AI 就自己打開瀏覽器找頁面、點按鈕、填表單、下載文件最后把結果交回來。它適合需要處理重復網頁操作的人——運營查數據、HR 填表格、測試跑回歸。下面從一個真實的重復勞動講起再帶你用三分鐘跑通第一個任務最后把提示詞寫法、模型選擇和常見坑一次講清。從一個真實場景說起小林是電商運營每天 9 點半做同一件事登錄三個競品頁面把 iPhone 15 的售價抄進 Excel。四十分鐘雷打不動還偶爾抄錯價格被領導問個清楚。她把這事寫成一段任務描述交給 browser-use瀏覽器自己打開、逐個站點搜索、讀取價格、生成一張 CSV 表格全程不到兩分鐘她只負責核對。這就是這個項目最典型的用法——把手動點擊換成一句任務描述。它能替你做什么像人一樣點擊、輸入、滾動、下載比如用這份簡歷填寫求職申請并勾選必填項它會自己定位每個輸入框填完再點提交把網頁內容變成結構化數據說抓取前 10 條商品名稱和價格導出 CSV得到的文件可以直接用 Excel 打開長時間重復執行比如每小時檢查一次官網是否 404異常就發郵件通知腳本掛上去就能一直跑自己擴展工具寫一個 Python 函數注冊成 AI 可調用的動作例如上傳簡歷文件倉庫 examples/apps/ 里有一個完整示例應用讓 AI 生成廣告素材和落地頁下圖就是其中一次生成結果自定義工具的寫法也很直白from browser_use import Tools tools Tools() tools.action(description上傳簡歷文件) def upload_resume(path: str) - str: # 把文件傳到你自己的服務器 return f已上傳 {path}把toolstools傳進Agent(...)之后AI 會在任務需要時自己決定什么時候調用它。三分鐘跑通第一個任務第一步安裝需要 Python 3.11并設置模型 API Keypip install browser-use # 或者 uv add browser-use export BROWSER_USE_API_KEYyour-key這個 Key 用于官方bu-*模型如果你已有 OpenAI、Anthropic 或 Google 的密鑰導出對應的變量即可。然后寫第一個腳本import asyncio from browser_use import Agent, ChatBrowserUse async def main(): agent Agent( taskSearch Google for what is browser automation and tell me the top 3 results, llmChatBrowserUse(modelbu-2-0-mini-preview), ) await agent.run() asyncio.run(main())運行后會彈出一個瀏覽器窗口自己完成搜索、讀取頁面并打印出前三條結果。想看源碼或跑倉庫里的示例可以執行git clone https://gitcode.com/GitHub_Trending/br/browser-use拉取后再本地安裝。任務提示詞寫法價格采集任務拆解任務描述的質量決定成敗的一半。拿開頭那個比價任務拆開看。需求怎么寫訪問京東、天貓、拼多多搜索 iPhone 15 收集每個站點第一條商品的商品名稱、價格、評價數量 整理成 CSV文件里只留這三列。三個要素缺一不可具體目標哪幾個站點、哪個型號、明確動作搜索后讀第一條、輸出格式CSV 加列名。避免幫我看看幾款手機的價格這種含糊說法AI 只能靠猜猜錯就是來回試。AI 實際做了什么依次打開三個站點 → 在搜索框輸入型號 → 搜索 → 讀取第一條商品的字段 → 逐行填表 → 寫出 CSV。某個站點搜不到時它會按你的規則如實說明無結果而不是編一個數字。你拿到什么一個本地 CSV 文件直接進 Excel 就是規整的三列表格不用再手動復制粘貼。另一個值得學的細節是寫失敗標準。官方 examples/use-cases/ 里有個簽證預約查詢的例子如果本月沒有可預約日期就看下個月兩個月都沒有就明確告訴我沒有日期。加一句兜底規則AI 就不會在死胡同里反復打轉。browser-use 是怎么工作的你不需要教它點哪個坐標。整體思路是每一輪先看當前頁面和任務進度讓模型決定下一步動作執行后觀察新頁面如此循環直到任務完成。分工大致是四層browser_use/agent/大腦負責任務規劃和逐步決策browser_use/browser/手控制真實 Chromium處理點擊、輸入、多標簽頁和下載browser_use/dom/眼睛把頁面結構轉成模型能讀的描述browser_use/tools/工具箱AI 可調用的標準動作加上你自定義的工具模型與成本怎么挑按預算三檔開源代碼本身遵循 MIT 協議免費你的成本主要是模型 API 調用。官方團隊用 100 個真實網頁任務對不同模型做了基準測試成功率對比如下追求效果選專為瀏覽器自動化優化的bu-*系列通過ChatBrowserUse接入官方數據顯示它比通用模型快 3~5 倍且成功率更高性價比Gemini 或 GPT-mini 這類小模型應付日常任務夠用且支持多供應商切換本地部署通過 Ollama 接入本地模型零 API 費用適合數據不能出內網的場景browser_use/llm/ 目錄下為各家供應商都備好了現成適配器切換時只改model參數即可。避坑指南任務描述太模糊 → 按目標 站點 輸出格式三要素重寫越具體越少走錯路長任務超時 → 拆成兩段任務分別執行或給 Agent 設置最大步數站點需要登錄 → 復用你現有的 Chrome 配置或先人工登錄一次保存會話狀態遇到驗證碼 → 先人工過一遍驗證再交給 AI風控嚴格的站點改用官方遠程瀏覽器方案并發開得太大 → Chromium 很吃內存先單跑確認穩定再逐步加并發常見問題它完全免費嗎開源庫本身免費MIT 協議你只為所用的模型 API 付費。支持哪些瀏覽器基于 Chromium 內核Chrome、Edge 等都可以也可以接上你已打開的瀏覽器實例。中文網站能用嗎能它不挑語言任務描述直接用中文寫也沒有問題。需要編程經驗嗎Python 庫需要一點基礎如果只是偶爾跑一次任務也可以把它接給現成的 AI 助手用一句話交代即可。會被網站檢測到嗎內置隨機延遲等擬人化行為如果目標站點風控嚴格建議走官方的遠程瀏覽器方案。看到這里可以直接pip install browser-use裝起來先跑一遍前面三分鐘那節里的搜索任務感受瀏覽器自己動起來的節奏。跑順之后翻一翻 examples/ 里的各種現成腳本挑一個改成你自己的任務就是最快的上手路徑。【免費下載鏈接】browser-use Make websites accessible for AI agents. Automate tasks online with ease.項目地址: https://gitcode.com/GitHub_Trending/br/browser-use創作聲明:本文部分內容由AI輔助生成(AIGC),僅供參考