IT ▾
Ottieni la chiave API

Integra l'API del modello AI senza censura

Ottieni la tua chiave API del modello AI senza censura e integra l'endpoint delle chat completions in pochi minuti. Modifica il tuo base_url e la chiave per passare alla nostra API compatibile con OpenAI pronta all'uso per risposte immediate e senza rifiuti.

Autenticazione e URL di base

La nostra API è progettata come una sostituzione pronta all'uso per i client OpenAI esistenti. Devi solo modificare due variabili: il base_url e la tua api_key. L'URL di base per tutte le richieste è https://api.llmmodelsapi.com/v1. L'autenticazione avviene tramite l'intestazione Authorization utilizzando un token Bearer. Assicurati di mantenere sicura la tua chiave API, poiché garantisce l'accesso al tuo credito prepagato. Puoi rigenerare la tua chiave in qualsiasi momento dal tuo dashboard, il che revoca immediatamente quella vecchia.

Prima richiesta

Invia una richiesta standard di chat completions per testare la connettività. Usa l'ID del modello uncensored per accedere al nostro modello linguistico di grandi dimensioni progettato appositamente. Questo modello è ottimizzato per rispondere senza rifiuti di contenuto per uso adulto legale, rendendolo ideale per gli agenti che necessitano di output coerenti. Il corpo della richiesta segue il formato standard delle chat completions OpenAI.

curl https://api.llmmodelsapi.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Verifica che la risposta includa un completamento valido. Se ricevi un codice di stato 200, la tua integrazione funziona correttamente. Questo ai model api endpoint supporta conversazioni sia a turno singolo che a turno multiplo all'interno della finestra di contesto.

Integrazione SDK Python

L'utilizzo dell'SDK Python ufficiale di OpenAI è il modo più veloce per integrare. Indica al client il nostro URL di base e fornisci la tua chiave API. L'SDK gestisce automaticamente la serializzazione e il pooling delle connessioni. Questo approccio funziona con qualsiasi libreria client compatibile con OpenAI che rispetti l'override del base_url.

from openai import OpenAI

client = OpenAI(base_url="https://api.llmmodelsapi.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

L'SDK Python supporta chiamate in streaming e sincrone. Per la maggior parte dei flussi di lavoro degli agenti, le chiamate sincrone sono più semplici, ma lo streaming è disponibile se devi visualizzare i token mentre vengono generati. L'ID del modello rimane uncensored indipendentemente dalla versione dell'SDK.

Integrazione SDK Node.js

Per gli ambienti JavaScript e TypeScript, l'SDK Node segue lo stesso pattern. Inizializza il client con l'URL di base e le credenziali corretti. Questo fa sì che il tuo codice esistente richieda modifiche minime per cambiare provider. L'ID del modello uncensored è compatibile con tutti i parametri standard di chat completion.

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.llmmodelsapi.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

L'SDK Node supporta anche i pattern async/await, rendendo semplice l'integrazione nelle route di Express o nelle funzioni serverless. Mantieni la tua chiave API nelle variabili di ambiente per evitare esposizioni accidentali. Questa openai compatible api architettura significa che puoi tornare a OpenAI o passare ad altri provider modificando solo l'oggetto di configurazione.

Risposte in streaming

Abilita lo streaming impostando stream: true nella tua richiesta. L'API restituisce uno stream di Server-Sent Events (SSE), permettendoti di elaborare i token mentre vengono generati. Questo riduce la latenza percepita per gli utenti finali ed è essenziale per le interazioni in tempo reale degli agenti. Il formato dello stream è identico alla specifica SSE di OpenAI.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Ogni frammento contiene dati delta parziali. Devi accumulare questi delta per ricostruire la risposta completa. Lo streaming non influisce sui prezzi; vieni addebitato per i token totali di input e output indipendentemente dalla modalità di streaming. Questa funzionalità fa parte della robusta chat completions api architettura che forniamo.

Limiti, errori e contesto

La nostra infrastruttura applica limiti rigorosi per garantire l'affidabilità. Hai un limite di 300 richieste al minuto per chiave, con una dimensione massima del corpo della richiesta di 8 MB. La finestra di contesto è di 100.000 token, condivisa tra prompt e completamento. Se superi il limite di richieste, riceverai un errore 429. Una chiave non valida restituisce 401, mentre un credito insufficiente restituisce 402. A differenza di molte opzioni di llm api provider, non nascondiamo questi limiti; sono trasparenti e coerenti. Non viene eseguita alcuna formazione sui tuoi dati e la privacy è mantenuta senza utilizzare i prompt per il miglioramento del modello.

Specifiche tecniche

Tutti i limiti e le funzioni reali dell'API in un unico posto: controllali prima di ricaricare.

VoceValore
Formatocompatibile OpenAI: qualsiasi SDK OpenAI funziona cambiando base URL e chiave
Base URLhttps://api.llmmodelsapi.com/v1
EndpointPOST /v1/chat/completions · GET /v1/models
AutenticazioneAuthorization: Bearer YOUR_KEY
ID modellouncensored
Function callingsì — tools, tool_choice; risposte con tool_calls anche in streaming; risultati come role: tool
Modalità JSONresponse_format: {"type": "json_object"}
Parametritemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Streamingsì — server-sent events; l'ultimo blocco riporta l'uso dei token
Output massimofino al resto della finestra di 64.000 token; max_tokens opzionale (nessun limite separato)
Finestra di contesto64.000 token (input + output)
HeaderX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Dimensionefino a 8 MB per richiesta
Limite di frequenza300 richieste al minuto per chiave
Concorrenza8 richieste contemporanee per chiave
Scadenzail credito pagato non scade, nessun abbonamento
Prova gratuita$0,50 per 7 giorni, senza carta · Chiave di prova: 2 richieste parallele, 60 al minuto; limiti completi (8 e 300) dopo la prima ricarica
Fatturazionecredito prepagato in base all'uso reale; errori e rifiuti gratuiti
Prezzo$0,25 per 1M token in input · $1,00 per 1M in output
Bonus+5% da $50, +10% da $100
RicaricaUSDT (TRC20) o USDC (Base), qualsiasi importo intero da $10 a $500
Contenuticontenuti per adulti consentiti; rifiutati i contenuti sessuali con minori
AccessoGoogle oppure e-mail e password
Chiaviuna chiave attiva per account; una nuova sostituisce la precedente

Codici di errore

Gli errori arrivano in JSON con un type fisso; le richieste fallite o rifiutate non si pagano.

CodiceTipoSignificato
400bad_requestJSON non valido, messaggi vuoti, parametro errato o contesto troppo lungo
401missing_key · invalid_key · key_revokedchiave mancante, errata o sostituita
402no_creditcredito esaurito — ricarica e riparti subito
403content_blockedcontenuti sessuali con minori — rifiutato, non addebitato
404not_foundendpoint sconosciuto
413request_too_largecorpo oltre 8 MB
429rate_limited · concurrencyoltre 300/min o 8 in parallelo — attendi e riprova
503upstream_busymodello occupato — riprova tra pochi secondi
01

Domande e risposte

È lo stesso modello di GPT-4 o Claude?

No. Il nostro modello è un modello a pesi aperti ottimizzato specificamente per risposte senza censura. Non è GPT, Claude, Gemini o il modello di nessun altro fornitore. È un modello distinto eseguito sui nostri server GPU.

Come funziona la tariffazione?

Utilizziamo un sistema di credito prepagato a consumo senza canoni mensili. I token di input costano $0,25 per 1M, mentre i token di output costano $1,00 per 1M. I crediti non scadono mai e puoi ricaricare con criptovalute (USDT o USDC) a partire da $10.

Cos'è il credito di prova?

Ogni nuovo account riceve $0,50 di credito di prova valido per 7 giorni. Non è necessaria una carta di credito o un numero di telefono per iniziare. Questo ti permette di testare il modello AI senza censura prima di decidere l'acquisto.

La tua chiave è a un modulo di distanza

Crea un account, copia la chiave, modifica l'URL di base. È tutta la configurazione.

Ottieni la chiave API