Guide de démarrage rapide pour les pipelines Vibevoice
Obtenez une sortie texte brute et sans censure de VibeVoice en quelques secondes. Ce guide montre comment intégrer notre API compatible openai dans votre pipeline à l'aide de SDK standards.
Prérequis
Avant l'intégration, assurez-vous d'avoir un compte actif. Inscrivez-vous via Google ou e-mail sur la page Obtenir clé API pour recevoir immédiatement votre clé unique. Aucune carte bancaire n'est nécessaire pour l'essai initial de 0,50 $. Notre LLM sans censure sert l'ID de modèle « uncensored » via un endpoint standard. L'URL de base est https://api.vibevoice.top/v1. Cette configuration fonctionne avec n'importe quel SDK OpenAI, ce qui en fait un remplacement prêt à l’emploi pour de nombreux pipelines existants.
Authentification
Transmettez votre clé API dans l'en-tête Authorization. Le format doit être « Bearer YOUR_API_KEY ». Si la clé est manquante ou invalide, l'API renvoie une erreur 401. Comme nous nous concentrons sur le traitement du texte, assurez-vous que votre pipeline n'envoie que des données textuelles. La clé est liée à un seul compte ; la génération d'une nouvelle clé remplace instantanément l'ancienne. Cette simplicité permet des itérations rapides dans votre environnement de développement.
Envoi d'une requête
Effectuez une requête POST vers /v1/chat/completions. Incluez l'identifiant du modèle, vos messages et tous les paramètres. Voici un exemple de base utilisant cURL :
curl https://api.vibevoice.top/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'Cette requête envoie une instruction simple au modèle. La réponse contient le texte généré. Vous pouvez ajuster des paramètres comme la température pour la créativité ou définir des limites strictes sur la longueur de la sortie. Cette approche directe est idéale pour générer des scripts, des légendes ou des variations de prompt pour d'autres outils.
Intégration du SDK Python
Utilisez la bibliothèque Python officielle d'OpenAI. Configurez l'URL de base pour pointer vers notre service. Transmettez votre clé API en tant que api_key. Cela vous permet d'utiliser des méthodes familières comme client.chat.completions.create(). Il s'agit d'une API compatible avec OpenAI, donc votre structure de code existante nécessite probablement peu de modifications. Cette méthode est parfaite pour le traitement en arrière-plan ou les tâches d'extraction de données.
from openai import OpenAI
client = OpenAI(base_url="https://api.vibevoice.top/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)N'oubliez pas de gérer les exceptions correctement. Les erreurs réseau ou les limites de débit peuvent interrompre votre pipeline. La journalisation de la réponse aide à déboguer pourquoi un prompt spécifique a été refusé ou a généré une sortie inattendue.
Intégration du SDK Node
Pour les environnements JavaScript, utilisez le package npm openai. Définissez les propriétés apiKey et baseURL dans l'objet de configuration. Cela garantit que les requêtes atteignent l'endpoint correct. Le SDK Node.js prend en charge les mêmes paramètres que la version Python. Il est idéal pour les serveurs web ou les fonctions edge qui doivent générer du texte à la demande.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.vibevoice.top/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Assurez-vous de gérer le cycle de vie de l'objet client pour éviter les fuites de ressources. Cette intégration est robuste pour gérer les tâches de génération de texte asynchrones dans les applications web modernes.
Réponses en streaming
Activez le streaming en définissant stream sur true dans votre requête. L'API renvoie des données par morceaux au fur et à mesure de leur génération. Cela est utile pour les affichages en temps réel ou le rendu progressif du texte. Le dernier morceau inclut les statistiques complètes d'utilisation des tokens. Le streaming réduit la latence perçue pour les utilisateurs finaux.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)Gérez correctement le stream pour garantir que toutes les données soient traitées. Si la connexion tombe, vous risquez de manquer les données d'utilisation finales. Cette fonctionnalité est précieuse pour les applications qui doivent afficher du texte au fur et à mesure de son écriture.
Fonctions et limites
Toutes les limites et fonctions réelles de l'API au même endroit — vérifiez-les avant de recharger.
| Élément | Valeur |
|---|---|
| Format | compatible OpenAI : tout SDK OpenAI fonctionne en changeant la base URL et la clé |
| Authentification | Authorization: Bearer YOUR_KEY |
| Endpoints | POST /v1/chat/completions · GET /v1/models |
| ID du modèle | uncensored |
| Base URL | https://api.vibevoice.top/v1 |
| Mode JSON | response_format: {"type": "json_object"} |
| Appel de fonctions | oui — tools, tool_choice ; réponse avec tool_calls, aussi en streaming ; résultats en role: tool |
| Fenêtre de contexte | 64 000 tokens (entrée + sortie) |
| Paramètres | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Sortie max. | jusqu'au reste de la fenêtre de 64 000 tokens ; max_tokens optionnel (pas de plafond distinct) |
| Streaming | oui — server-sent events ; le dernier bloc contient l'usage des tokens |
| Limite de débit | 300 requêtes par minute et par clé |
| Taille | jusqu'à 8 Mo par requête |
| Concurrence | 8 requêtes simultanées par clé |
| En-têtes | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Essai gratuit | 0,50 $ pendant 7 jours, sans carte · Clé d'essai : 2 requêtes parallèles, 60 par minute ; limites complètes (8 et 300) après la 1re recharge |
| Recharge | USDT (TRC20) ou USDC (Base), tout montant entier de 10 $ à 500 $ |
| Bonus | +5 % dès 50 $, +10 % dès 100 $ |
| Validité | le crédit payé n'expire jamais, sans abonnement |
| Prix | 0,25 $ par million de tokens en entrée · 1,00 $ par million en sortie |
| Facturation | crédit prépayé selon l'usage réel ; erreurs et refus gratuits |
| Contenu | contenu adulte autorisé ; tout contenu sexuel impliquant des mineurs est refusé |
| Clés | une clé active par compte ; une nouvelle remplace l'ancienne |
| Connexion | Google ou e-mail et mot de passe |
Erreurs et solutions
Les erreurs arrivent en JSON avec un type stable ; les requêtes échouées ou refusées ne sont pas facturées.
| Code | Type | Signification |
|---|---|---|
400 | bad_request | JSON invalide, messages vides, mauvais paramètre ou contexte trop long |
401 | missing_key · invalid_key · key_revoked | clé absente, erronée ou remplacée |
402 | no_credit | plus de crédit — rechargez, la reprise est immédiate |
403 | content_blocked | contenu sexuel impliquant des mineurs — refusé, non facturé |
404 | not_found | endpoint inconnu |
413 | request_too_large | corps supérieur à 8 Mo |
429 | rate_limited · concurrency | au-delà de 300/min ou 8 en parallèle — patientez |
503 | upstream_busy | modèle occupé — réessayez dans quelques secondes |
Questions et réponses
Quelles sont les limites de débit ?
Vous êtes limité à 300 requêtes par minute par clé et à 8 requêtes simultanées. Le corps de la requête ne doit pas dépasser 8 Mo. Le dépassement de ces limites génère une erreur 429.
Comment fonctionne la tarification ?
Vous payez 0,25 $ par 1 M de tokens d'entrée et 1,00 $ par 1 M de tokens de sortie. Le crédit est rechargé via crypto (USDT ou USDC) et n'expire jamais. Les erreurs et les refus sont gratuits.
Quelle est la fenêtre de contexte ?
La fenêtre de contexte totale est de 100 000 tokens pour le prompt et la complétion combinés. La sortie maximale par requête est de 32 000 tokens, ou 2 048 si max_tokens n'est pas spécifié.
Votre clé est à un formulaire de vous
Créez un compte, copiez la clé, modifiez l'URL de base. C'est toute la configuration.