Browser Use ist eine Open-Source-Bibliothek in Python, mit der ein AI Agent einen Webbrowser bedient: Seiten öffnen, klicken, Formulare ausfüllen, Inhalte auslesen. Du beschreibst die Aufgabe in natürlicher Sprache, ein Sprachmodell entscheidet Schritt für Schritt, was im Browser passiert. Neben der Bibliothek gibt es eine Kommandozeile, mit der bestehende Agenten wie Claude Code oder Codex Browserzugriff bekommen, und ein kostenpflichtiges Cloud-Angebot mit gehosteten Browsern. Dieser Artikel erklärt Funktionsweise, Einstieg, Einsatzfelder und Grenzen.
Steckbrief (Stand Oktober 2026)
| Merkmal | Angabe |
|---|---|
| Lizenz | MIT |
| GitHub | über 110.000 Sterne (Stand Oktober 2026) |
| Sprache | Python ab 3.11 |
| Installation | uv add browser-use oder pip install browser-use |
| Modelle | OpenAI, Anthropic, Google, eigene Browser-Use-Modelle, lokale Modelle über Ollama |
| Nutzungswege | Python-Bibliothek, CLI für bestehende Agenten, gehostete Cloud-API |
| Cloud | Gehostete Browser mit Proxys und CAPTCHA-Behandlung, nutzungsbasierte Abrechnung |
Wie Browser Use funktioniert
- Browser Use startet einen Chromium-Browser (lokal oder in der Cloud) und steuert ihn über das Chrome DevTools Protocol.
- Der aktuelle Seitenzustand wird für das Modell aufbereitet: eine vereinfachte Liste der interaktiven Elemente aus dem DOM, auf Wunsch ergänzt um einen Screenshot.
- Das Modell entscheidet über die nächste Aktion, etwa "klicke Element 12" oder "tippe Text in Feld 4".
- Browser Use führt die Aktion aus, liest den neuen Zustand und wiederholt die Schleife, bis die Aufgabe erledigt ist oder ein Schrittlimit erreicht ist.
Der Ansatz basiert also vor allem auf dem DOM und nicht auf reiner Bilderkennung. Das macht ihn schnell und vergleichsweise günstig, solange die Seite ein brauchbares DOM hat.
Einstieg
uv init --python 3.12
uv add browser-use
API-Schlüssel des Modellanbieters in .env eintragen, dann:
import asyncio
from browser_use import Agent, ChatOpenAI # oder ChatAnthropic, ChatGoogle, ChatBrowserUse
async def main():
agent = Agent(
task="Öffne die Website der Deutschen Bahn und finde die nächste Verbindung von Köln nach Berlin.",
llm=ChatOpenAI(model="<modellname>"),
)
history = await agent.run()
print(history.final_result())
asyncio.run(main())
Mit Browser(use_cloud=True) und einem BROWSER_USE_API_KEY läuft der Browser stattdessen in der Cloud von Browser Use. Eigene Funktionen kannst du über Tools registrieren, etwa um Ergebnisse direkt in eine Datenbank zu schreiben.
Typische Einsatzfelder
- Formulare ausfüllen: Daten aus einer Tabelle in Webportale übertragen, die keine API haben.
- Datenabgleich und Recherche: Preise, Verfügbarkeiten oder Kontaktdaten auf mehreren Seiten sammeln.
- Tests: Benutzerabläufe in natürlicher Sprache beschreiben und prüfen lassen.
- Agenten mit Browserzugang: Über die CLI bekommt ein Coding Agent die Möglichkeit, Webseiten zu öffnen, etwa zum Prüfen einer eigenen Webanwendung.
Stärken
- Schneller Einstieg: Wenige Zeilen Code für einen funktionierenden Agenten.
- Freie Modellwahl inklusive lokaler Modelle.
- Große Community mit vielen Beispielen und Integrationen in Agent-Frameworks.
- Lokal und in der Cloud nutzbar, mit Wiederverwendung eines vorhandenen Chrome-Profils für angemeldete Sitzungen.
Grenzen
- Zuverlässigkeit: Bei komplexen oder ungewöhnlichen Seiten verirrt sich der Agent oder bricht ab. Für wiederkehrende, kritische Abläufe ist klassische Automatisierung mit Playwright oft robuster.
- Kosten pro Lauf: Jeder Schritt ist ein Modellaufruf. Lange Abläufe werden teuer und langsam.
- Bot-Erkennung: Viele Seiten blockieren automatisierte Browser. Die Cloud bietet Gegenmaßnahmen, eine Garantie gibt es nicht.
- Rechtliches: Nutzungsbedingungen von Webseiten, Datenschutz und Urheberrecht gelten auch für Agenten. Kläre vor dem Einsatz, ob du die Daten automatisiert abrufen darfst.
- Sicherheit: Webseiten können Anweisungen enthalten, die den Agenten manipulieren (Prompt Injection). Gib dem Agenten keinen Zugriff auf Konten, die er für die Aufgabe nicht braucht.
Browser Use im Vergleich
| Browser Use | Skyvern | Stagehand | |
|---|---|---|---|
| Ansatz | Agent auf Basis des DOM | Vision-Modelle plus Playwright | Playwright-ähnliche API mit KI-Befehlen |
| Sprache | Python | Python, TypeScript-Client | TypeScript, Python, Go |
| Lizenz | MIT | AGPL-3.0 | MIT |
| Stärke | Freie Aufgaben mit wenig Code | Seiten mit wechselndem Layout, Workflows | Kombination aus festem Code und KI-Schritten |
Den direkten Vergleich findest du unter Browser Use vs. Skyvern, eine Einordnung von Stagehand im Blogbeitrag Stagehand im Vergleich.
Für wen eignet sich Browser Use?
- Python-Entwickler, die schnell einen Agenten mit Browserzugriff brauchen
- Teams mit Agent-Frameworks, die Browser-Aufgaben als Werkzeug einbinden wollen
- Prototypen und interne Werkzeuge, bei denen gelegentliche Fehlschläge akzeptabel sind