Pro většinu podnikových aplikací je standardem využití RESTful API. Tento přístup umožňuje snadnou autentizaci přes OAuth2 a bezproblémové předávání JSON objektů. Při integraci velkých jazykových modelů (LLM) je však nutné počítat s delší dobou odezvy, což vyžaduje implementaci asynchronních požadavků. Pokud systém čeká na vygenerování obsáhlé analýzy, synchronní spojení by mohlo vypršet (timeout), proto doporučujeme model "Request-ID", kde server pošle potvrzení o přijetí a výsledek doručí přes registrovaný webhook.
Technické požadavky na endpointy
- Rate Limiting: Implementace token bucket algoritmu pro zamezení překročení limitů poskytovatele AI (např. 3500 požadavků za minutu).
- Retry Logic: Automatické opakování požadavku při chybě 429 (Too Many Requests) s exponenciálním prodlevou.
- Streaming: Využití Server-Sent Events (SSE) pro postupné zobrazování textu uživateli v reálném čase, což snižuje vnímanou latenci.
- Caching: Ukládání identických dotazů do Redis databáze pro úsporu nákladů a okamžitou odezvu u opakujících se úloh.
Kromě standardních API existuje možnost nasazení lokálních modelů přes Llama.cpp nebo vLLM server. Tento přístup je kritický pro firmy pracující s citlivými daty, která nesmí opustit lokální síť. Lokální integrace vyžaduje specifický hardware (NVIDIA A100/H100), ale eliminuje variabilitu latence způsobenou internetovým připojením a externími servery. Více o těchto metodách naleznete v naší technické dokumentaci metod.