









Doubleword est une plateforme d’inférence IA destinée aux workloads à fort volume. Elle offre un accès compatible avec OpenAI à des modèles de langage, de vision, d’OCR et d’embeddings à poids ouverts. Elle prend en charge l’inférence en temps réel, asynchrone et par lots, avec une livraison sous environ 24 heures, permettant de privilégier les économies de tokens au détriment de la latence. Doubleword est conçue pour le raisonnement agentique, les évaluations, la génération de données synthétiques, l’annotation, l’extraction, les workflows de programmation et le traitement de données à grande échelle. Sa stack d’inférence intègre des technologies d’optimisation telles que FlashOffload, Speculative KV Coding et Cloudburst afin d’améliorer le débit, l’efficacité du cache et les temps de démarrage.
Créez une clé API Doubleword, sélectionnez un modèle open-weight pris en charge et utilisez l’API compatible avec OpenAI en remplaçant l’URL de base de votre application existante par api.doubleword.ai. Choisissez une livraison en temps réel, asynchrone ou par lots selon vos exigences en matière de latence et de coût. Envoyez des prompts, des tâches agentiques, des jobs d’évaluation, des workflows d’extraction ou des fichiers de traitement par lots, puis suivez et récupérez les résultats via l’API ou l’interface Doubleword. Les équipes peuvent également demander de l’aide pour la migration, l’optimisation des prompts, le réglage des files d’attente, une tarification personnalisée ou des déploiements dédiés.

Inférence en temps réel
Basée sur l’utilisation ; tarifs standards de l’inférence en temps réel
Latence minimale pour les applications interactives, les conversations et les sessions en direct.
Inférence asynchrone
Basée sur l’utilisation ; jusqu’à 50 % moins cher que les tarifs en temps réel
Résultats généralement livrés en quelques minutes à quelques heures pour les agents en arrière-plan et les workloads à haut débit.
Inférence par lots
Basée sur l’utilisation ; jusqu’à 80 % moins cher que les tarifs en temps réel
Livraison sous environ 24 heures pour les jobs importants lorsque la priorité est de minimiser les coûts.
Tarif par lots le plus bas indiqué
20 $ par milliard de tokens d’entrée
Tarification par lots de Qwen3-Embedding-8B ; les tokens de sortie ne sont pas facturés pour ce modèle d’embeddings.
Tarif génératif par lots le plus bas indiqué
90 $ par milliard de tokens d’entrée et par milliard de tokens de sortie
Tarification par lots de GPT-OSS-20B.
Tarification personnalisée pour les entreprises
Nous contacter pour obtenir un tarif
Disponible pour les remises sur volume, les workloads importants et les déploiements dédiés.


17.17%
Écoute des médias sociaux