Groq Batch API 가이드: 비동기 JSONL 작업과 결과 회수

핵심 답변

Groq Batch API는 JSONL 요청 파일을 업로드하여 대규모 추론 작업을 동기식 엔드포인트 대비 50% 할인된 비용으로 처리할 수 있는 비동기 서비스입니다. 표준 API 처리율 제한에 영향을 주지 않으며 24시간에서 최대 7일 사이의 유연한 처리 윈도우를 설정할 수 있습니다.

핵심 정보 한눈에 보기

제품 / 모델 현재 ID 또는 버전 용도 근거
groq 이 항목에서는 제품 고유의 선택 가능한 모델 ID가 검증되지 않았습니다. 제품의 현재 제공 범위 확인 공식 출처 공식 출처

오류 유형과 검증

오류 유형 검증 방법
오래된 모델 또는 버전 정보 게시 전에 모델 이름과 ID를 공식 출처와 비교합니다.
형식이 맞지 않거나 불완전한 출력 문서화된 명세와 고정된 테스트 입력으로 응답을 검증합니다.
검증되지 않은 사실 주장 공식 출처가 뒷받침하지 않는 주장은 한계를 명시하거나 삭제합니다.

자주 묻는 질문

Groq Batch API를 사용할 때 얻을 수 있는 주요 비용 혜택은 무엇인가요?

Groq Batch API를 사용하면 공식 Groq Batch Documentation에 명시된 대로 일반 동기식 엔드포인트 대비 50% 할인된 요금으로 추론을 실행할 수 있습니다.

배치 작업 실행이 조직의 표준 동기식 처리율 제한에 영향을 미치나요?

배치 작업은 비동기로 처리되므로 표준 API Rate Limit에 아무런 영향을 주지 않으며, 기존 운영 서비스의 동기식 호출 한도를 잠식하지 않고 독립 실행됩니다.

배치 50% 할인 요율은 프롬프트 캐싱 할인과 중복으로 적용될 수 있나요?

아니요, 배치 할인은 프롬프트 캐싱 할인과 중복 적용되지 않으며, 캐시 히트 여부와 무관하게 모든 배치 토큰은 일괄 50% 단일 배치 요율로 청구됩니다.

배치 작업의 완료 기한(Processing Window)은 어떻게 설정할 수 있나요?

작업 생성 시 24시간에서 최대 7일 사이의 윈도우를 구성할 수 있으며, 시스템 용량 상황에 따른 작업 만료를 방지하기 위해 충분히 긴 윈도우 설정을 권장합니다.

배치 입력 JSONL 파일에서 호출 가능한 API 엔드포인트는 무엇인가요?

Groq API Reference에 기재된 바와 같이 /v1/chat/completions, /v1/audio/transcriptions, /v1/audio/translations 엔드포인트를 POST 메서드로 지정할 수 있습니다.

출처와 확인 날짜

상세 가이드

Groq Batch API 개요

Groq Batch API는 대규모 데이터 세트 처리, 오프라인 평가, 대량 콘텐츠 생성과 같이 즉각적인 응답이 필요하지 않은 워크로드를 비동기적으로 실행할 수 있도록 설계된 인터페이스입니다. 동기식 엔드포인트 대비 50% 할인된 가격으로 제공되며, 표준 API 처리율 제한(Rate Limits)을 소비하지 않고 독립적으로 처리됩니다. 자세한 사양과 라이프사이클은 Groq Batch DocumentationGroq API Reference에서 확인할 수 있습니다.

이 항목에서는 제품 고유의 선택 가능한 모델 ID가 검증되지 않았습니다. 공식 문서에 명시된 모델 식별자는 고정된 기본값이나 전체 지원 목록이 아니라 문서화된 예시 선택 항목으로 취급되어야 합니다.

JSONL 파일 규격 및 지원 엔드포인트

배치 작업은 각 줄이 개별 요청을 나타내는 JSON Lines(JSONL) 파일로 구성됩니다. 각 줄의 JSON 객체는 다음 네 가지 필수 요소를 포함해야 합니다:

  1. custom_id: 각 요청을 추적하고 반환된 결과와 대조하기 위한 고유 식별자 문자열입니다.
  2. method: HTTP 메서드로 현재 POST만 지원됩니다.
  3. url: 호출할 엔드포인트 경로로 /v1/chat/completions, /v1/audio/transcriptions, /v1/audio/translations 중 하나여야 합니다.
  4. body: 동기식 API 파라미터와 동일한 규격의 요청 본문 객체입니다.

비동기 배치 수명 주기 및 실행 단계

Groq Batch API를 통한 작업 처리는 다음 단계를 통해 진행됩니다:

  1. JSONL 파일 작성: 각 줄에 고유한 custom_id, POST 메서드, 유효한 엔드포인트 URL 및 본문 데이터를 갖춘 JSONL 파일을 생성합니다.
  2. 파일 업로드: Groq 파일 관리 API를 호출하여 준비한 JSONL 요청 파일을 업로드하고 고유 파일 ID를 획득합니다.
  3. 배치 작업 생성: 업로드된 파일 ID를 참조하고 24시간에서 7일 사이의 완료 윈도우를 설정하여 배치 작업을 시작합니다.
  4. 상태 폴링 및 모니터링: 배치 조회 엔드포인트를 주기적으로 호출하여 처리 진행률 및 완료 여부를 확인합니다.
  5. 결과 파일 회수: 배치가 완료되면 생성된 출력 파일 식별자를 기반으로 결과를 다운로드하여 각 custom_id별 출력을 매핑합니다.

문서화된 배치 모델 예시

공식 가이드에 예시로 수록된 엔드포인트별 모델 목록은 다음과 같습니다:

엔드포인트 URL 예시 모델 식별자 지원 모달리티
/v1/chat/completions llama-3.1-8b-instant, llama-3.3-70b-versatile, openai/gpt-oss-20b, openai/gpt-oss-120b, meta-llama/llama-guard-4-12b 텍스트 및 비전 대화 생성
/v1/audio/transcriptions whisper-large-v3, whisper-large-v3-turbo 오디오 음성 전사
/v1/audio/translations whisper-large-v3 오디오 음성 번역

가격 정책, 캐싱 적용 및 만료 처리

Batch API는 동기식 가격 대비 일괄 50% 요금 할인이 적용됩니다. 주의할 점은 이 할인이 프롬프트 캐싱 할인과 중복 적용되지 않는다는 점입니다. 캐시 여부와 무관하게 모든 배치 토큰은 50% 단일 배치 요율로 청구됩니다. 또한 지정된 24시간~7일 윈도우 내에 완료되지 못한 요청은 만료 처리되므로 용량이 큰 작업에는 충분히 긴 윈도우를 설정하는 것이 권장됩니다.

운영 준비 점검표 (Checklist)

  • 모든 입력 요청이 올바른 JSON Lines 규격을 준수하고 줄바꿈이 올바른지 검증했는지 확인합니다.
  • 결과 대조를 위해 각 라인마다 고유한 custom_id가 지정되어 있는지 확인합니다.
  • 작업량 크기에 맞춰 24시간에서 7일 범위 내의 충분한 처리 윈도우를 설정했는지 확인합니다.
  • 프롬프트 캐싱 할인이 배치 요율과 중복 적용되지 않음을 비용 산정에 반영했는지 확인합니다.
  • 엔드포인트 호출 및 상태 모니터링 규격에 대해 Groq API Reference를 확인했는지 검토합니다.

근거와 최신성

근거 수준: 공식 문서 검증

AI-assisted editorial content; verify current product details against the linked official sources.

마지막 검증:

주요 출처

다른 도구 둘러보기

Mistral API 가이드: Agents·Conversations와 상태 기반 handoff가이드Claude API 가이드: 멀티도구 워크플로우의 프로그래밍 방식 도구 호출가이드GitHub Copilot 가이드: 커스텀 에이전트와 서브에이전트 오케스트레이션가이드Gemini API 가이드: URL 컨텍스트와 검색 그라운딩가이드OpenAI Responses API 가이드: 백그라운드 실행과 컨텍스트 관리가이드GitHub Copilot 가이드: 권한·감사·복구를 위한 Hooks가이드Claude Agent SDK 가이드: 동적 멀티에이전트 워크플로우가이드Microsoft Agent Framework 가이드: HITL 요청과 checkpoint 재개가이드Claude Code 가이드: 훅 수명주기 자동화와 실행 경계가이드Cloudflare Agents 가이드: 내구성 워크플로우와 사람 승인가이드Timeline Studio 가이드: 브라우저에서 실행하는 로컬 우선 AI 영상 편집가이드NVIDIA NeMo Agent Toolkit 가이드: 평가·profiling과 tracing가이드Amazon Bedrock AgentCore Memory 가이드: 전략·namespace와 검색가이드Gemini API 가이드: File Search 저장소와 RAG 경계가이드Copilot Studio 가이드: 가드레일 기반 자율 에이전트 운영가이드Claude Code 가이드: 플러그인 패키징·테스트와 배포가이드LangGraph 가이드: persistence·checkpoint와 내구성 있는 에이전트 복구가이드Vercel AI SDK 가이드: ToolLoopAgent·루프 제어와 승인가이드OpenAI Agents SDK 가이드: tracing·span과 민감 데이터 제어가이드Amazon Bedrock AgentCore 가이드: 런타임·세션과 에이전트 엔드포인트가이드