ES ▾
Obtener clave de API

Integra la API del Modelo de IA Sin Censura

Obtén tu clave de API del modelo de IA sin censura e integra el endpoint de completados de chat en minutos. Cambia tu base_url y clave para pasar a nuestra API compatible con OpenAI lista para usar y obtener respuestas sin rechazos.

Autenticación y URL base

Nuestra API está diseñada como un reemplazo listo para usar para clientes de OpenAI existentes. Solo necesitas cambiar dos variables: la base_url y tu api_key. La URL base para todas las peticiones es https://api.llmmodelsapi.com/v1. La autenticación se maneja mediante el encabezado Authorization usando un token Bearer. Asegúrate de mantener segura tu clave de API, ya que otorga acceso a tu crédito prepago. Puedes regenerar tu clave en cualquier momento desde tu panel, lo que revoca inmediatamente la anterior.

Primera petición

Envía una petición estándar de completado de chat para probar la conectividad. Usa el ID de modelo uncensored para acceder a nuestro modelo de lenguaje grande diseñado a medida. Este modelo está ajustado para responder sin rechazos de contenido para uso adulto lícito, lo que lo hace ideal para agentes que necesitan salidas consistentes. El cuerpo de la petición sigue el formato estándar de completados de chat de OpenAI.

curl https://api.llmmodelsapi.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Verifica que la respuesta incluya una finalización válida. Si recibes un código de estado 200, tu integración funciona correctamente. Este endpoint ai model api soporta conversaciones de turno único y múltiple dentro de la ventana de contexto.

Integración con SDK de Python

Usar el SDK oficial de OpenAI para Python es la forma más rápida de integrar. Apunta el cliente a nuestra URL base y proporciona tu clave de API. El SDK maneja la serialización y el agrupamiento de conexiones automáticamente. Este enfoque funciona con cualquier biblioteca de cliente compatible con OpenAI que respete la sobrescritura de base_url.

from openai import OpenAI

client = OpenAI(base_url="https://api.llmmodelsapi.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

El SDK de Python soporta streaming y llamadas sincrónicas. Para la mayoría de flujos de trabajo de agentes, las llamadas sincrónicas son más simples, pero el streaming está disponible si necesitas mostrar tokens a medida que se generan. El ID de modelo sigue siendo uncensored independientemente de la versión del SDK.

Integración con SDK de Node.js

Para entornos JavaScript y TypeScript, el SDK de Node.js sigue el mismo patrón. Inicializa el cliente con la URL base y las credenciales correctas. Esto asegura que tu base de código existente requiera cambios mínimos para cambiar de proveedor. El ID de modelo uncensored es compatible con todos los parámetros estándar de completado de chat.

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.llmmodelsapi.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

El SDK de Node también admite patrones async/await, lo que facilita su integración en rutas de Express o funciones serverless. Mantén tu clave de API en variables de entorno para evitar su exposición accidental. Este diseño de openai compatible api significa que puedes volver a OpenAI o cambiar a otros proveedores modificando únicamente el objeto de configuración.

Respuestas en streaming

Habilita el streaming estableciendo stream: true en tu petición. La API devuelve un flujo de Server-Sent Events (SSE), lo que te permite procesar tokens a medida que se generan. Esto reduce la latencia percibida para los usuarios finales y es esencial para interacciones de agentes en tiempo real. El formato del flujo es idéntico a la especificación SSE de OpenAI.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Cada fragmento contiene datos delta parciales. Debes acumular estos deltas para reconstruir la respuesta completa. El streaming no afecta el precio; se te cobra por los tokens totales de entrada y salida independientemente del modo de streaming. Esta función es parte del diseño robusto de chat completions api que proporcionamos.

Límites, errores y contexto

Nuestra infraestructura aplica límites estrictos para garantizar la fiabilidad. Tienes un límite de 300 peticiones por minuto por clave, con un tamaño máximo de cuerpo de petición de 8 MB. La ventana de contexto es de 100,000 tokens, compartida entre prompt y finalización. Si excedes el límite de peticiones, recibirás un error 429. Una clave inválida devuelve 401, y crédito insuficiente devuelve 402. A diferencia de muchos proveedores de llm api provider, no ocultamos estos límites; son transparentes y consistentes. No se realiza entrenamiento con tus datos, y la privacidad se mantiene sin usar prompts para mejorar el modelo.

Funciones y límites

Todos los límites y funciones reales de la API en un solo lugar: revísalos antes de recargar.

ElementoValor
Formatocompatible con OpenAI: cualquier SDK de OpenAI funciona cambiando la base URL y la clave
Base URLhttps://api.llmmodelsapi.com/v1
EndpointsPOST /v1/chat/completions · GET /v1/models
AutenticaciónAuthorization: Bearer YOUR_KEY
ID del modelouncensored
Llamadas a funcionessí: tools, tool_choice; la respuesta trae tool_calls, también en streaming; resultados como role: tool
Modo JSONresponse_format: {"type": "json_object"}
Parámetrostemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Streamingsí: server-sent events; el último fragmento incluye el uso de tokens
Salida máximahasta el resto de la ventana de 64.000 tokens; max_tokens opcional (sin límite aparte)
Ventana de contexto64.000 tokens (entrada + salida)
CabecerasX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Tamaño de peticiónhasta 8 MB
Límite de peticiones300 por minuto por clave
Concurrencia8 peticiones a la vez por clave
Caducidadel crédito pagado no caduca, sin suscripción
Prueba gratis$0,50 durante 7 días, sin tarjeta · Clave de prueba: 2 solicitudes paralelas, 60 por minuto; límites completos (8 y 300) tras la primera recarga
Facturacióncrédito prepago por uso real; errores y rechazos no se cobran
Precio$0,25 por 1M tokens de entrada · $1,00 por 1M de salida
Bono+5 % desde $50, +10 % desde $100
RecargaUSDT (TRC20) o USDC (Base), cualquier importe entero de $10 a $500
Contenidocontenido adulto permitido; se rechaza el contenido sexual con menores
AccesoGoogle o correo y contraseña
Clavesuna clave activa por cuenta; una nueva reemplaza a la anterior

Códigos de error

Los errores llegan como JSON con un type fijo; las peticiones fallidas o rechazadas no se cobran.

CódigoTipoSignificado
400bad_requestJSON inválido, mensajes vacíos, parámetro incorrecto o contexto demasiado largo
401missing_key · invalid_key · key_revokedfalta la clave, es incorrecta o fue reemplazada
402no_creditsin crédito: recarga y sigue al instante
403content_blockedcontenido sexual con menores: rechazado, no se cobra
404not_foundendpoint desconocido
413request_too_largecuerpo mayor de 8 MB
429rate_limited · concurrencymás de 300/min o 8 en paralelo: espera y reintenta
503upstream_busymodelo ocupado: reintenta en unos segundos
01

Preguntas y respuestas

¿Es el mismo modelo que GPT-4 o Claude?

No. Nuestro modelo es un modelo de pesos abiertos ajustado específicamente para respuestas sin censura. No es GPT, Claude, Gemini ni ningún otro modelo de otro proveedor. Es un modelo distinto ejecutado en nuestros propios servidores GPU.

¿Cómo funciona la facturación?

Usamos un sistema de crédito prepago de pago por uso sin cuotas mensuales. Los tokens de entrada cuestan $0,25 por 1M, y los tokens de salida cuestan $1,00 por 1M. Los créditos no caducan y puedes recargar con criptomonedas (USDT o USDC) a partir de $10.

¿Qué es el crédito de prueba?

Cada cuenta nueva recibe $0,50 en crédito de prueba válido por 7 días. No se requiere tarjeta de crédito ni número de teléfono para comenzar. Esto te permite probar el <code>modelo de IA sin censura</code> antes de comprometerte con una compra.

Tu clave está a un formulario de distancia

Crea una cuenta, copia la clave, cambia la URL base. Eso es toda la configuración.

Obtener clave de API