









Doubleword ist eine KI-Inferenzplattform für Workloads mit hohem Volumen. Sie bietet OpenAI-kompatiblen Zugriff auf frei verfügbare Sprach-, Vision-, OCR- und Embedding-Modelle. Unterstützt werden Echtzeit-, asynchrone und etwa 24 Stunden dauernde Batch-Inferenz, sodass Nutzer Latenz gegen deutlich niedrigere Tokenkosten eintauschen können. Doubleword ist für agentisches Schlussfolgern, Evaluierungen, die Erzeugung synthetischer Daten, Annotationen, Extraktions- und Coding-Workflows sowie die Verarbeitung großer Datenmengen ausgelegt. Der Inferenz-Stack umfasst Optimierungstechnologien wie FlashOffload, Speculative KV Coding und Cloudburst, die Durchsatz, Cache-Effizienz und Startzeiten verbessern.
Erstellen Sie einen Doubleword-API-Schlüssel, wählen Sie ein unterstütztes frei verfügbares Modell aus und verwenden Sie die OpenAI-kompatible API, indem Sie die bestehende API-Basis-URL auf api.doubleword.ai ändern. Wählen Sie je nach Latenz- und Kostenanforderungen die Echtzeit-, asynchrone oder Batch-Zustellung. Übermitteln Sie Prompts, Agentenaufgaben, Evaluierungsjobs, Extraktions-Workflows oder Batch-Dateien und überwachen Sie die Ergebnisse bzw. rufen Sie sie über die API oder die Doubleword-Oberfläche ab. Teams können außerdem Unterstützung bei der Migration, Prompt-Optimierung, Warteschlangen-Konfiguration, individuellen Preisen oder dedizierten Bereitstellungen anfordern.

Echtzeit-Inferenz
Nutzungsabhängig; reguläre Echtzeit-Tarife
Niedrigste Latenz für interaktive Anwendungen, Chats und Live-Sitzungen.
Asynchrone Inferenz
Nutzungsabhängig; bis zu 50 % günstiger als Echtzeit-Tarife
Ergebnisse werden für Hintergrundagenten und Workloads mit hohem Durchsatz in der Regel innerhalb von Minuten bis Stunden bereitgestellt.
Batch-Inferenz
Nutzungsabhängig; bis zu 80 % günstiger als Echtzeit-Tarife
Zustellung innerhalb von etwa 24 Stunden für große Jobs, bei denen die Kostenminimierung im Vordergrund steht.
Niedrigster aufgeführter Batch-Tarif
20 $ pro 1 Milliarde Eingabetoken
Batch-Preis für Qwen3-Embedding-8B; Ausgabetoken werden bei diesem Embedding-Modell nicht berechnet.
Niedrigster aufgeführter generativer Batch-Tarif
90 $ pro 1 Milliarde Eingabe- und 1 Milliarde Ausgabetoken
Batch-Preis für GPT-OSS-20B.
Individuelle Enterprise-Preise
Preis auf Anfrage
Verfügbar für Mengenrabatte, große Workloads und dedizierte Bereitstellungen.




Social Media Listening