









Doubleword는 대규모 워크로드를 위한 AI 추론 플랫폼으로, 오픈 웨이트 언어·비전·OCR·임베딩 모델에 OpenAI 호환 방식으로 액세스할 수 있도록 제공합니다. 실시간, 비동기 및 약 24시간 내 처리되는 배치 추론을 지원하여 지연 시간을 줄이는 대신 토큰 비용을 크게 절감할 수 있습니다. Doubleword는 에이전트형 추론, 평가, 합성 데이터 생성, 주석 처리, 정보 추출, 코딩 워크플로 및 대규모 데이터 처리에 적합하게 설계되었습니다. 추론 스택에는 처리량, 캐시 효율성 및 시작 시간을 개선하는 FlashOffload, Speculative KV Coding, Cloudburst 등의 최적화 기술이 포함되어 있습니다.
Doubleword API 키를 생성하고 지원되는 오픈 웨이트 모델을 선택한 다음, 기존 API의 기본 URL을 api.doubleword.ai로 변경하여 OpenAI 호환 API를 사용합니다. 지연 시간과 비용 요구사항에 따라 실시간, 비동기 또는 배치 처리를 선택할 수 있습니다. API 또는 Doubleword 인터페이스를 통해 프롬프트, 에이전트 작업, 평가 작업, 정보 추출 워크플로 또는 배치 파일을 제출하고 결과를 모니터링하거나 가져옵니다. 팀은 마이그레이션 지원, 프롬프트 최적화, 큐 조정, 맞춤형 요금제 또는 전용 배포도 요청할 수 있습니다.

실시간 추론
사용량 기반; 실시간 요금 전액 적용
대화형 애플리케이션, 채팅 및 실시간 세션에 적합한 최저 지연 시간 처리.
비동기 추론
사용량 기반; 실시간 요금 대비 최대 50% 할인
백그라운드 에이전트 및 고처리량 워크로드를 위해 일반적으로 수분에서 수 시간 내 결과 제공.
배치 추론
사용량 기반; 실시간 요금 대비 최대 80% 할인
비용 절감이 우선인 대규모 작업을 위한 약 24시간 내 처리.
최저 배치 요금
입력 토큰 10억 개당 20달러
Qwen3-Embedding-8B 배치 요금이며, 이 임베딩 모델은 출력 토큰에 요금이 부과되지 않습니다.
최저 생성형 배치 요금
입력 토큰 10억 개 및 출력 토큰 10억 개당 90달러
GPT-OSS-20B 배치 요금.
맞춤형 엔터프라이즈 요금
문의 필요
대량 할인, 대규모 워크로드 및 전용 배포에 제공됩니다.


소셜 리스닝