









Doubleword 是一個面向高流量工作負載的 AI 推論平台,提供與 OpenAI 相容的開放權重語言、視覺、OCR 與嵌入模型存取介面。平台支援即時、非同步,以及約 24 小時完成的批次推論,讓使用者在延遲與 Token 成本之間取得平衡,大幅降低每個 Token 的費用。Doubleword 適合代理式推理、模型評估、合成資料生成、標註、資訊擷取、程式碼工作流程,以及大規模資料處理。其推論技術堆疊包含 FlashOffload、Speculative KV Coding 與 Cloudburst 等最佳化技術,可提升吞吐量、快取效率與啟動速度。
建立 Doubleword API 金鑰,選擇支援的開放權重模型,並使用與 OpenAI 相容的 API;只需將現有應用程式的 API 基礎網址改為 api.doubleword.ai。依據延遲與成本需求,選擇即時、非同步或批次交付模式。提交提示詞、代理任務、模型評估工作、資訊擷取流程或批次檔案,然後透過 API 或 Doubleword 介面監控並取得結果。團隊也可以申請遷移協助、提示詞最佳化、佇列調校、客製化定價或專屬部署。

即時推論
按用量計費;採用完整即時推論費率
延遲最低,適合互動式應用程式、聊天與即時工作階段。
非同步推論
按用量計費;相較即時推論最高可享 50% 折扣
通常在數分鐘至數小時內交付結果,適合背景代理與高吞吐量工作負載。
批次推論
按用量計費;相較即時推論最高可享 80% 折扣
約 24 小時完成交付,適合以降低成本為優先的大型工作。
目前列出的最低批次費率
每 10 億個輸入 Token 20 美元
Qwen3-Embedding-8B 的批次定價;此嵌入模型不收取輸出 Token 費用。
目前列出的最低生成式批次費率
每 10 億個輸入 Token 與 10 億個輸出 Token 共 90 美元
GPT-OSS-20B 的批次定價。
企業客製化定價
請聯絡洽詢
適用於大量採購折扣、大型工作負載與專屬部署。

社群媒體聆聽