Integra la API del Modelo de IA Sin Censura
Obtén tu clave de API del modelo de IA sin censura e integra el endpoint de completados de chat en minutos. Cambia tu base_url y clave para pasar a nuestra API compatible con OpenAI lista para usar y obtener respuestas sin rechazos.
Autenticación y URL base
Nuestra API está diseñada como un reemplazo listo para usar para clientes de OpenAI existentes. Solo necesitas cambiar dos variables: la base_url y tu api_key. La URL base para todas las peticiones es https://api.llmmodelsapi.com/v1. La autenticación se maneja mediante el encabezado Authorization usando un token Bearer. Asegúrate de mantener segura tu clave de API, ya que otorga acceso a tu crédito prepago. Puedes regenerar tu clave en cualquier momento desde tu panel, lo que revoca inmediatamente la anterior.
Primera petición
Envía una petición estándar de completado de chat para probar la conectividad. Usa el ID de modelo uncensored para acceder a nuestro modelo de lenguaje grande diseñado a medida. Este modelo está ajustado para responder sin rechazos de contenido para uso adulto lícito, lo que lo hace ideal para agentes que necesitan salidas consistentes. El cuerpo de la petición sigue el formato estándar de completados de chat de OpenAI.
curl https://api.llmmodelsapi.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'
Verifica que la respuesta incluya una finalización válida. Si recibes un código de estado 200, tu integración funciona correctamente. Este endpoint ai model api soporta conversaciones de turno único y múltiple dentro de la ventana de contexto.
Integración con SDK de Python
Usar el SDK oficial de OpenAI para Python es la forma más rápida de integrar. Apunta el cliente a nuestra URL base y proporciona tu clave de API. El SDK maneja la serialización y el agrupamiento de conexiones automáticamente. Este enfoque funciona con cualquier biblioteca de cliente compatible con OpenAI que respete la sobrescritura de base_url.
from openai import OpenAI
client = OpenAI(base_url="https://api.llmmodelsapi.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)
El SDK de Python soporta streaming y llamadas sincrónicas. Para la mayoría de flujos de trabajo de agentes, las llamadas sincrónicas son más simples, pero el streaming está disponible si necesitas mostrar tokens a medida que se generan. El ID de modelo sigue siendo uncensored independientemente de la versión del SDK.
Integración con SDK de Node.js
Para entornos JavaScript y TypeScript, el SDK de Node.js sigue el mismo patrón. Inicializa el cliente con la URL base y las credenciales correctas. Esto asegura que tu base de código existente requiera cambios mínimos para cambiar de proveedor. El ID de modelo uncensored es compatible con todos los parámetros estándar de completado de chat.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llmmodelsapi.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);
El SDK de Node también admite patrones async/await, lo que facilita su integración en rutas de Express o funciones serverless. Mantén tu clave de API en variables de entorno para evitar su exposición accidental. Este diseño de openai compatible api significa que puedes volver a OpenAI o cambiar a otros proveedores modificando únicamente el objeto de configuración.
Respuestas en streaming
Habilita el streaming estableciendo stream: true en tu petición. La API devuelve un flujo de Server-Sent Events (SSE), lo que te permite procesar tokens a medida que se generan. Esto reduce la latencia percibida para los usuarios finales y es esencial para interacciones de agentes en tiempo real. El formato del flujo es idéntico a la especificación SSE de OpenAI.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
Cada fragmento contiene datos delta parciales. Debes acumular estos deltas para reconstruir la respuesta completa. El streaming no afecta el precio; se te cobra por los tokens totales de entrada y salida independientemente del modo de streaming. Esta función es parte del diseño robusto de chat completions api que proporcionamos.
Límites, errores y contexto
Nuestra infraestructura aplica límites estrictos para garantizar la fiabilidad. Tienes un límite de 300 peticiones por minuto por clave, con un tamaño máximo de cuerpo de petición de 8 MB. La ventana de contexto es de 100,000 tokens, compartida entre prompt y finalización. Si excedes el límite de peticiones, recibirás un error 429. Una clave inválida devuelve 401, y crédito insuficiente devuelve 402. A diferencia de muchos proveedores de llm api provider, no ocultamos estos límites; son transparentes y consistentes. No se realiza entrenamiento con tus datos, y la privacidad se mantiene sin usar prompts para mejorar el modelo.
Funciones y límites
Todos los límites y funciones reales de la API en un solo lugar: revísalos antes de recargar.
| Elemento | Valor |
|---|---|
| Formato | compatible con OpenAI: cualquier SDK de OpenAI funciona cambiando la base URL y la clave |
| Base URL | https://api.llmmodelsapi.com/v1 |
| Endpoints | POST /v1/chat/completions · GET /v1/models |
| Autenticación | Authorization: Bearer YOUR_KEY |
| ID del modelo | uncensored |
| Llamadas a funciones | sí: tools, tool_choice; la respuesta trae tool_calls, también en streaming; resultados como role: tool |
| Modo JSON | response_format: {"type": "json_object"} |
| Parámetros | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Streaming | sí: server-sent events; el último fragmento incluye el uso de tokens |
| Salida máxima | hasta el resto de la ventana de 64.000 tokens; max_tokens opcional (sin límite aparte) |
| Ventana de contexto | 64.000 tokens (entrada + salida) |
| Cabeceras | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Tamaño de petición | hasta 8 MB |
| Límite de peticiones | 300 por minuto por clave |
| Concurrencia | 8 peticiones a la vez por clave |
| Caducidad | el crédito pagado no caduca, sin suscripción |
| Prueba gratis | $0,50 durante 7 días, sin tarjeta · Clave de prueba: 2 solicitudes paralelas, 60 por minuto; límites completos (8 y 300) tras la primera recarga |
| Facturación | crédito prepago por uso real; errores y rechazos no se cobran |
| Precio | $0,25 por 1M tokens de entrada · $1,00 por 1M de salida |
| Bono | +5 % desde $50, +10 % desde $100 |
| Recarga | USDT (TRC20) o USDC (Base), cualquier importe entero de $10 a $500 |
| Contenido | contenido adulto permitido; se rechaza el contenido sexual con menores |
| Acceso | Google o correo y contraseña |
| Claves | una clave activa por cuenta; una nueva reemplaza a la anterior |
Códigos de error
Los errores llegan como JSON con un type fijo; las peticiones fallidas o rechazadas no se cobran.
| Código | Tipo | Significado |
|---|---|---|
400 | bad_request | JSON inválido, mensajes vacíos, parámetro incorrecto o contexto demasiado largo |
401 | missing_key · invalid_key · key_revoked | falta la clave, es incorrecta o fue reemplazada |
402 | no_credit | sin crédito: recarga y sigue al instante |
403 | content_blocked | contenido sexual con menores: rechazado, no se cobra |
404 | not_found | endpoint desconocido |
413 | request_too_large | cuerpo mayor de 8 MB |
429 | rate_limited · concurrency | más de 300/min o 8 en paralelo: espera y reintenta |
503 | upstream_busy | modelo ocupado: reintenta en unos segundos |
Preguntas y respuestas
¿Es el mismo modelo que GPT-4 o Claude?
No. Nuestro modelo es un modelo de pesos abiertos ajustado específicamente para respuestas sin censura. No es GPT, Claude, Gemini ni ningún otro modelo de otro proveedor. Es un modelo distinto ejecutado en nuestros propios servidores GPU.
¿Cómo funciona la facturación?
Usamos un sistema de crédito prepago de pago por uso sin cuotas mensuales. Los tokens de entrada cuestan $0,25 por 1M, y los tokens de salida cuestan $1,00 por 1M. Los créditos no caducan y puedes recargar con criptomonedas (USDT o USDC) a partir de $10.
¿Qué es el crédito de prueba?
Cada cuenta nueva recibe $0,50 en crédito de prueba válido por 7 días. No se requiere tarjeta de crédito ni número de teléfono para comenzar. Esto te permite probar el <code>modelo de IA sin censura</code> antes de comprometerte con una compra.
Tu clave está a un formulario de distancia
Crea una cuenta, copia la clave, cambia la URL base. Eso es toda la configuración.