
무설치·인프라 구축 필요 없이 POST 한 번으로 범용·추론·코딩·멀티모달·경제형으로 엄선한 30개 LLM을 즉시 호출할 수 있는 RESTful 전용 중계 API입니다. 완전 stateless — 서버는 대화 히스토리·세션·페르소나 데이터를 일절 보관하지 않습니다.
별도의 텍스트 도구 엔드포인트(/rest/llm/text_summary, /rest/llm/text_polish)는 100P 고정 과금으로 제공됩니다.
같은 /chat 엔드포인트지만 사용 목적에 따라 접근 방식이 다릅니다. 본인 상황에 맞는 가이드부터 시작하세요.
/chat 은 각 모델에 정해진 input 1M 토큰당 포인트·output 1M 토큰당 포인트 단가로 요청마다 실제 사용 토큰에 비례해 자동 과금됩니다. 1포인트 = 1원 (부가세별도).
모델별 단가·max_context 는 POST /rest/llm/models 응답으로 조회하세요. 카탈로그 + 가격표가 한 응답에 통합되어 있습니다.
/chat 에서 앱이 신경써야 할 파라미터는 8개로 압축되어 있습니다:
model, messages/content, system, temperature, max_tokens, speed, compact.
나머지 top_p, top_k, presence_penalty, frequency_penalty, seed, logit_bias, n, repetition_penalty, response_format, tools, tool_choice, stop, user 같은 "잘 안 쓰는" 파라미터는 서버가 무시하고 안전한 기본값으로 동작합니다. max_tokens 는 미지정 시 각 모델이 지원하는 최대 컨텍스트까지 자동 허용되며, 지정해도 모델 한계를 초과하면 조용히 클램프됩니다 (긴 답변 짤림·업스트림 400 오류 방지).
messages[] 로 관리.