Browser-Audio-Erfassung für Openclaw

Eine Brücke, die es KI-Agenten ermöglicht, Echtzeit-Audiostreams von jedem Browser-Tab ohne plattformspezifische Integrationen zu erfassen und zu verarbeiten.

jarvis563
v1.1.0
Feb 27, 2026
0
1.2k
0

Installieren & Herunterladen

1. ClawHub CLI

Der schnellste Weg, einen Skill direkt aus der Registry zu installieren.

npx clawhub@latest install browser-audio-capture

2. Manuelle Installation

Kopiere den Skill-Ordner an einen dieser Orte

Global
~/.openclaw/skills/
Workspace
<project>/skills/

Priorität: Workspace > Lokal > Integriert (Bundled)

3. Prompt-Installation

Kopiere diesen Prompt in OpenClaw, um ihn automatisch zu installieren.

Hilf mir, browser-audio-capture über Clawhub zu installieren. Falls Clawhub nicht installiert ist, installiere es bitte zuerst (npm i -g clawhub).

Lieber herunterladen?

Hole dir die rohen Skill-Dateien in einem ZIP-Archiv.

Was ist Browser-Audio-Erfassung?

Browser Audio Capture ist ein spezialisiertes Dienstprogramm, das entwickelt wurde, um KI-Agenten in einer Webumgebung auditive Fähigkeiten zu verleihen. Indem es als Brücke zwischen der Medienebene des Browsers und Ihrer KI-Pipeline fungiert, ermöglicht es die nahtlose Extraktion von Audio aus Meetings, Webinaren und Streaming-Plattformen. Als Teil des Openclaw Skills-Ökosystems macht dieses Tool komplexe API-Schlüssel oder plattformspezifische OAuth-Setups überflüssig und ist somit eine universelle Lösung für Entwickler, die intelligente Zuhörer erstellen.

Dieser Skill ist auf Flexibilität ausgelegt und unterstützt sowohl ein Python-basiertes CLI für automatisierte Workflows als auch eine dedizierte Chrome-Erweiterung für die manuelle, dauerhafte Erfassung. Egal, ob Sie einen Echtzeit-Meeting-Assistenten oder einen automatisierten Podcast-Notizschreiber erstellen, dieser Skill liefert die Rohaudiodaten, die für moderne Transkriptions- und Analysemodelle erforderlich sind.

Browser-Audio-Erfassung Anwendungsfälle

  • Erstellung automatisierter Echtzeit-Meeting-Zusammenfassungen für Google Meet, Zoom und Microsoft Teams.
  • Extraktion verwertbarer Notizen und Erkenntnisse aus YouTube-Videos, Podcasts und Online-Kursen.
  • Überwachung von Ergebnisbesprechungen und Live-Webinaren für Wettbewerbsanalysen.
  • Analyse von Kundensupport-Anrufen oder Verkaufsdemos über browserbasierte VoIP-Tools.
  • Ermöglicht es KI-Agenten, auf Live-Audio-Signale während Streaming-Events oder Discord-Sitzungen zu reagieren.

So funktioniert Browser-Audio-Erfassung

  1. Der Benutzer startet Chrome mit aktiviertem Remote-Debugging auf Port 9222, um externe Interaktionen zu ermöglichen.
  2. Die Openclaw Skills-Komponente identifiziert den Ziel-Browser-Tab über das CLI oder die Benutzeroberfläche der Erweiterung.
  3. Der Skill klinkt sich in den Audiostream des Browsers ein und erfasst hochwertige PCM16-Audiodaten in Echtzeit.
  4. Das erfasste Audio wird in eine JSON-Struktur verpackt, die die Base64-Rohdaten und Quell-Metadaten enthält.
  5. Die Nutzlast wird an einen lokalen oder remote HTTP-Endpunkt (Standardport 8900) zur Verarbeitung durch Ihren KI-Agenten gestreamt.

Browser-Audio-Erfassung Einrichtung

Um zu starten, starten Sie Google Chrome mit aktiviertem Remote-Debugging-Port:

/Applications/Google\ Chrome.app/Contents/MacOS/Google\ Chrome \
  --remote-debugging-port=9222 --user-data-dir=$HOME/.chrome-debug-profile &

Installieren Sie die erforderlichen Python-Abhängigkeiten:

pip install aiohttp

Verwenden Sie für das CLI-Erlebnis die folgenden Befehle, um Ihre Erfassungssitzungen zu verwalten:

# Audio von einem Meeting-Tab erkennen und erfassen
python3 -m browser_capture.cli capture

# Alle 15 Sekunden nach neuen Tabs suchen
python3 -m browser_capture.cli watch --interval 15

Um die Chrome-Erweiterung zu verwenden, navigieren Sie zu chrome://extensions/, aktivieren Sie den Entwicklermodus und wählen Sie 'Entpackte Erweiterung laden', um das Erweiterungsverzeichnis auszuwählen.

Browser-Audio-Erfassung Datenschema & Taxonomie

Der Skill streamt Daten als JSON-Nutzlast an den konfigurierten Endpunkt. Dieses strukturierte Format stellt sicher, dass der Openclaw Skills-Verbraucher alle notwendigen Kontexte für den Audiostream erhält.

Eigenschaft Typ Beschreibung
sessionId String Eine eindeutige Kennung für die spezifische Erfassungssitzung.
audio String Base64-kodierte PCM16-Audiodaten.
sampleRate Integer Die Abtastrate des Streams (Standard 16000).
format String Das Audioformat (z. B. "pcm16").
tabUrl String Die Quell-URL, von der das Audio erfasst wird.
tabTitle String Der HTML-Titel des Quell-Tabs.

Browser-Audio-Erfassung Erweiterte Funktionen

  • Kontinuierlicher Überwachungsmodus zur automatisierten Erkennung von Meeting-Tabs basierend auf URL-Mustern.
  • Dauerhafte Erfassung im Hintergrund, die es der Erweiterung ermöglicht, Audio auch nach dem Schließen des Popups zu streamen.
  • Multi-Agenten-Kompatibilität mit Unterstützung für Openclaw Skills, LangChain, CrewAI und benutzerdefinierte HTTP-Empfänger.
  • Direkte Integrationsmöglichkeiten mit Transkriptionsdiensten wie Whisper, Deepgram und NVIDIA Riva.
  • Leichtgewichtige PCM16-Kodierung zur Minimierung von Latenz und CPU-Last bei kritischen Erfassungen.

SKILL.md


Laden

Verwandte Openclaw-Skills

METADATA

Github Stars: 0
forks: 0

Hervorgehoben*