Intégrez l'API du modèle IA sans censure
Obtenez votre clé API du modèle IA sans censure et intégrez l'endpoint de complétions de chat en quelques minutes. Modifiez votre base_url et votre clé pour passer à notre API compatible OpenAI prêt à l'emploi pour des réponses immédiates sans refus.
Authentification et URL de base
Notre API est un remplacement prêt à l'emploi pour les clients OpenAI existants. Modifiez uniquement base_url et api_key. L'URL de base est https://api.llmmodelsapi.com/v1. L'authentification utilise l'en-tête Authorization avec un token Bearer. Protégez votre clé API qui accède à votre crédit prépayé. Renouvelez-la depuis votre tableau de bord, révoquant l'ancienne immédiatement.
Première requête
Envoyez une requête de complétion de chat standard pour tester la connectivité. Utilisez l’ID de modèle uncensored pour accéder à notre modèle de langage large conçu à cet effet. Ce modèle est ajusté pour répondre sans refus de contenu pour une utilisation adulte légale, ce qui le rend idéal pour les agents nécessitant des sorties cohérentes. Le corps de la requête suit le format standard des complétions de chat OpenAI.
curl https://api.llmmodelsapi.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'
Vérifiez que la réponse inclut une complétion valide. Si vous recevez un code de statut 200, votre intégration fonctionne correctement. Cet endpoint ai model api prend en charge les conversations à tour unique et multi-tour au sein de la fenêtre de contexte.
Intégration SDK Python
L’utilisation du SDK Python officiel OpenAI est la méthode la plus rapide pour intégrer. Pointez le client vers notre URL de base et fournissez votre clé API. Le SDK gère automatiquement la sérialisation et le pool de connexions. Cette approche fonctionne avec toute bibliothèque cliente compatible OpenAI qui respecte le remplacement de base_url.
from openai import OpenAI
client = OpenAI(base_url="https://api.llmmodelsapi.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)
Le SDK Python prend en charge le streaming et les appels synchrones. Pour la plupart des flux de travail d'agents, les appels synchrones sont plus simples, mais le streaming est disponible si vous devez afficher les tokens au fur et à mesure de leur génération. L'ID de modèle reste uncensored quelle que soit la version du SDK.
Intégration SDK Node.js
Pour les environnements JavaScript et TypeScript, le SDK Node.js suit le même modèle. Initialisez le client avec l'URL de base et les identifiants corrects. Cela garantit que votre base de code existante nécessite des modifications minimales pour changer de fournisseur. L'ID de modèle uncensored est compatible avec tous les paramètres standard de complétion de chat.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llmmodelsapi.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);
Le SDK Node prend également en charge les modèles async/await, facilitant l’intégration dans les routes Express ou les fonctions serverless. Conservez votre clé API dans les variables d’environnement pour éviter toute exposition accidentelle. Cette conception d’API openai compatible api signifie que vous pouvez revenir à OpenAI ou passer à d’autres fournisseurs en modifiant uniquement l’objet de configuration.
Réponses en streaming
Activez le streaming en définissant stream: true dans votre requête. L’API retourne un flux Server-Sent Events (SSE), vous permettant de traiter les tokens au fur et à mesure de leur génération. Cela réduit la latence perçue pour les utilisateurs finaux et est essentiel pour les interactions en temps réel avec les agents. Le format du flux est identique à la spécification SSE d’OpenAI.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
Chaque chunk contient des données partielles. Vous devez accumuler ces deltas pour reconstituer la réponse complète. Le streaming n'affecte pas la tarification ; vous êtes facturé pour le total des tokens d'entrée et de sortie, quel que soit le mode de streaming. Cette fonctionnalité fait partie de la conception robuste de l'API chat completions api que nous fournissons.
Limites, erreurs et contexte
Notre infrastructure applique des limites strictes pour garantir la fiabilité. Vous êtes limité à 300 requêtes par minute par clé, avec une taille maximale de corps de requête de 8 MB. La fenêtre de contexte est de 100 000 tokens, partagée entre le prompt et la complétion. Si vous dépassez la limite de débit, vous recevrez une erreur 429. Une clé invalide renvoie 401, et un crédit insuffisant renvoie 402. Contrairement à de nombreuses options de llm api provider, nous ne masquons pas ces limites ; elles sont transparentes et cohérentes. Aucune formation n'est effectuée sur vos données, et la confidentialité est préservée en n'utilisant pas les prompts pour l'amélioration du modèle.
Fonctions et limites
Toutes les limites et fonctions réelles de l'API au même endroit — vérifiez-les avant de recharger.
| Élément | Valeur |
|---|---|
| Format | compatible OpenAI : tout SDK OpenAI fonctionne en changeant la base URL et la clé |
| Base URL | https://api.llmmodelsapi.com/v1 |
| Endpoints | POST /v1/chat/completions · GET /v1/models |
| Authentification | Authorization: Bearer YOUR_KEY |
| ID du modèle | uncensored |
| Appel de fonctions | oui — tools, tool_choice ; réponse avec tool_calls, aussi en streaming ; résultats en role: tool |
| Mode JSON | response_format: {"type": "json_object"} |
| Paramètres | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Streaming | oui — server-sent events ; le dernier bloc contient l'usage des tokens |
| Sortie max. | jusqu'au reste de la fenêtre de 64 000 tokens ; max_tokens optionnel (pas de plafond distinct) |
| Fenêtre de contexte | 64 000 tokens (entrée + sortie) |
| En-têtes | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Taille | jusqu'à 8 Mo par requête |
| Limite de débit | 300 requêtes par minute et par clé |
| Concurrence | 8 requêtes simultanées par clé |
| Validité | le crédit payé n'expire jamais, sans abonnement |
| Essai gratuit | 0,50 $ pendant 7 jours, sans carte · Clé d'essai : 2 requêtes parallèles, 60 par minute ; limites complètes (8 et 300) après la 1re recharge |
| Facturation | crédit prépayé selon l'usage réel ; erreurs et refus gratuits |
| Prix | 0,25 $ par million de tokens en entrée · 1,00 $ par million en sortie |
| Bonus | +5 % dès 50 $, +10 % dès 100 $ |
| Recharge | USDT (TRC20) ou USDC (Base), tout montant entier de 10 $ à 500 $ |
| Contenu | contenu adulte autorisé ; tout contenu sexuel impliquant des mineurs est refusé |
| Connexion | Google ou e-mail et mot de passe |
| Clés | une clé active par compte ; une nouvelle remplace l'ancienne |
Codes d'erreur
Les erreurs arrivent en JSON avec un type stable ; les requêtes échouées ou refusées ne sont pas facturées.
| Code | Type | Signification |
|---|---|---|
400 | bad_request | JSON invalide, messages vides, mauvais paramètre ou contexte trop long |
401 | missing_key · invalid_key · key_revoked | clé absente, erronée ou remplacée |
402 | no_credit | plus de crédit — rechargez, la reprise est immédiate |
403 | content_blocked | contenu sexuel impliquant des mineurs — refusé, non facturé |
404 | not_found | endpoint inconnu |
413 | request_too_large | corps supérieur à 8 Mo |
429 | rate_limited · concurrency | au-delà de 300/min ou 8 en parallèle — patientez |
503 | upstream_busy | modèle occupé — réessayez dans quelques secondes |
Questions et réponses
S'agit-il du même modèle que GPT-4 ou Claude ?
Non. Notre modèle est un modèle à poids ouverts ajusté spécifiquement pour des réponses sans censure. Il ne s'agit pas de GPT, Claude, Gemini ou de tout autre modèle d'un autre fournisseur. C'est un modèle distinct exécuté sur nos propres serveurs GPU.
Comment fonctionne la tarification ?
Nous utilisons un système de crédit prépayé avec paiement à l'usage et sans frais mensuels. Les tokens d'entrée coûtent 0,25 $ par 1M, et les tokens de sortie coûtent 1,00 $ par 1M. Les crédits n'expirent jamais, et vous pouvez les recharger avec des cryptomonnaies (USDT ou USDC) à partir de 10 $.
Qu'est-ce que le crédit d'essai ?
Chaque nouveau compte reçoit 0,50 $ de crédit d'essai valable 7 jours. Aucune carte de crédit ou numéro de téléphone n'est requis pour commencer. Cela vous permet de tester le <code>modèle IA sans censure</code> avant de vous engager.
Votre clé est à un formulaire de vous
Créez un compte, copiez la clé, modifiez l'URL de base. C'est toute l'installation.