









Doubleword 是一个面向高负载工作负载的 AI 推理平台,提供与 OpenAI 兼容的开源权重语言、视觉、OCR 和嵌入模型访问能力。平台支持实时、异步以及约 24 小时完成的批量推理,让用户能够通过牺牲部分延迟来大幅降低 Token 成本。Doubleword 专为智能体推理、评测、合成数据生成、数据标注、信息提取、代码工作流和大规模数据处理而设计。其推理技术栈包含 FlashOffload、Speculative KV Coding 和 Cloudburst 等优化技术,可提升吞吐量、缓存效率并缩短启动时间。
创建 Doubleword API 密钥,选择受支持的开源权重模型,并通过与 OpenAI 兼容的 API 进行调用,只需将现有 API 的基础 URL 修改为 api.doubleword.ai。根据延迟和成本要求,选择实时、异步或批量交付模式。提交提示词、智能体任务、评测任务、信息提取工作流或批量文件,然后通过 API 或 Doubleword 界面监控并获取结果。团队还可以申请迁移协助、提示词优化、队列调优、定制价格或专属部署。

实时推理
按使用量计费;采用实时推理的标准费率
延迟最低,适用于交互式应用、聊天和实时会话。
异步推理
按使用量计费;相较实时推理最高可享受 50% 折扣
通常会在几分钟到几小时内返回结果,适用于后台智能体和高吞吐工作负载。
批量推理
按使用量计费;相较实时推理最高可享受 80% 折扣
约 24 小时完成交付,适用于优先考虑成本的大型任务。
最低列示批量费率
每 10 亿个输入 Token 20 美元
Qwen3-Embedding-8B 的批量价格;该嵌入模型不收取输出 Token 费用。
最低列示生成式模型批量费率
每 10 亿个输入 Token 和 10 亿个输出 Token 共 90 美元
GPT-OSS-20B 的批量价格。
企业定制价格
联系咨询价格
适用于批量折扣、大型工作负载和专属部署。

社交媒体聆听