Infrastructure Digio

Modèles IA et GPU

Exécutez des agents sur des modèles de frontière gérés dès aujourd'hui ou louez de la capacité GPU, déployez vos propres pondérations et acheminez les tâches Digio vers des points de terminaison privés dans le même espace de travail.

Claude, GPT, Gémeaux Sélection de modèle par agent Location de GPU & BYOM
Modèles gérés

Modèles disponibles chez Digio aujourd'hui

Attribuez un modèle par défaut par agent ou remplacez par tâche. L'utilisation est mesurée en jetons Digio à partir du solde de votre forfait : le même portefeuille, que l'agent appelle Sonnet, GPT-4o ou Gemini Flash.

Claude Anthropique

  • Claude Opus 4.7 Raisonnement phare, contexte long, travail d'architecture et de stratégie.
  • Claude Opus 4.6 Opus de génération précédente pour une analyse stable et de haute qualité.
  • Claude Sonnet 4.6 Pilote quotidien : codage, écriture et boucles d'agent en plusieurs étapes.
  • Claude Sonnet 4.5 / 4 Niveaux Sonnet rapides avec mise en cache rapide sur les charges de travail prises en charge.
  • Claude Haiku 4.5 Brouillons à faible latence, classification et sous-tâches à volume élevé.

Étiquette d’interface utilisateur du site Web B2B SaaS. Traduire en fr naturel : OpenAI

  • GPT-5.5 / GPT-5.4 / GPT-5.2 Dernière famille GPT-5 pour les charges de travail générales et agents.
  • GPT-4.1 & GPT-4o Chat multimodal fiable et utilisation d’outils pour les agents de production.
  • GPT-4o mini Routage rentable pour les résumés et les étapes légères.
  • o3 / o3-pro / o3-mini / o4-mini Modèles axés sur le raisonnement pour les mathématiques, la planification et la vérification.
  • GPT-5.3 Codex & Codex mini Génération de code, refactorisation et compétences d'agent sensibles aux dépôts.

Google Gémeaux

  • Gemini 2.5 Pro Recherche de contexte long et extraction structurée.
  • Gemini 2.5 Flash Étapes d'agent à haut débit avec des taux de jetons compétitifs.
  • Gemini 2.0 Flash Passes ultra-rapides pour l’analyse, le marquage et les tâches par lots.

API ouvertes et spécialisées

  • DeepSeek Chat & Reasoner Forte valeur pour les tâches de type chat et chaîne de pensée.
  • Mistral Large Option hébergée en Europe pour les équipes d'agents multilingues.
  • Llama 3.3 70B Modèle de classe à pondération ouverte via API : se marie bien avec un GPU privé.
  • Grok 3 Modèle orienté temps réel pour les agents de nouvelles et de surveillance sociale.
  • Sonar Pro Des réponses fondées sur la recherche pour les agents de recherche.
  • Command R+ Flux de travail de discussion et de récupération d'entreprise adaptés à RAG.

Model list and token economics evolve with provider releases. Your workspace shows live options when you assign a model to an agent; Digio Tokens debit from the same balance as in pricing.

Étiquette d’interface utilisateur du site Web B2B SaaS. Traduire en fr naturel : Utilisation

Comment les agents choisissent un modèle

Le coordinateur peut recommander Sonnet vs Opus plutôt qu'un modèle flash moins cher en fonction du type de tâche. Les utilisateurs expérimentés définissent les valeurs par défaut par rôle d'agent : recherche sur Sonnet, révision finale sur Opus, marquage en masse sur Haiku ou Gemini Flash.

  • Per agent — default model in agent settings; override in To do or chat when needed.

  • Metered fairly — input, output, and cached tokens map to Digio Token charges (see usage in your wallet).

  • Skills stay the same — tools and integrations work across models; only latency and cost profile change.

  • Plan limits — more agents and monthly Digio Tokens on higher tiers; top up anytime on the pricing page.

Location de GPU

Louez un GPU et exécutez vos propres modèles

Besoin d’un réglage fin, d’un point de contrôle isolé ou d’une tarification d’inférence prévisible ? Ajoutez une capacité GPU dédiée à votre espace de travail Digio, installez la pile de services que vous préférez et dirigez les agents vers votre point de terminaison privé.

Instances dédiées

Nœuds GPU horaires ou mensuels (classe A100, H100, L40S) attachés à votre locataire, isolés des autres clients.

Vos poids

Téléchargez des safetensors, GGUF ou extrayez-les de votre registre ; exécutez Llama, Mistral, Qwen et des réglages personnalisés.

Portion standard

Images vLLM, TGI, Ollama ou conteneurs que vous gérez : les agents Digio appellent une URL de base compatible OpenAI.

Même orchestration

Pour ce faire, les discussions en équipe, les compétences et la collaboration restent inchangées : seul le backend d'inférence vous appartient.

Routage hybride

Envoyez les étapes sensibles à un GPU privé et utilisez Claude ou GPT pour la recherche publique en un seul flux de travail.

Contrôles d'entreprise

Appairage de VPC, sortie statique, journaux d'audit et listes d'autorisation de modèles pour les équipes réglementées.

Apportez votre propre modèle

Installer et connecter un modèle personnalisé

Configuration typique de zéro jusqu'aux agents appelant votre point de terminaison :

  1. Réserver le GPU

    Choisissez la VRAM, la région et la disponibilité (en rafale ou en permanence). Le stockage des poids est livré avec l'instance ou monte votre seau.

  2. Déployer la pile

    Démarrez une image de diffusion ou SSH, installez les pilotes CUDA et chargez les points de contrôle. Les contrôles de santé confirment que le modèle est prêt.

  3. Enregistrer le point de terminaison

    Ajoutez l'URL de base, la clé API et l'ID de modèle dans les paramètres de l'espace de travail. Digio valide la latence et le format du jeton avant la mise en ligne.

  4. Attribuer aux agents

    Choisissez votre modèle privé comme modèle par défaut pour les agents sélectionnés ; Les modèles Claude/GPT gérés restent disponibles côte à côte.

La location du GPU est facturée séparément des abonnements au forfait Digio. Contactez-nous pour la planification de la capacité, les SLA et la migration à partir d'un cluster d'inférence existant.

Étiquette d’interface utilisateur du site Web B2B SaaS. Traduire en fr naturel : FAQ

Questions sur les modèles et les GPU

Choisir des API gérées plutôt qu'une inférence auto-hébergée sur Digio.

Dois-je payer deux fois : forfait plus API ?

Votre abonnement Digio couvre l'infrastructure, les agents et les jetons Digio inclus. L'utilisation du modèle géré débite ce jeton équilibré par les jetons d'entrée/sortie réels. La location de GPU est un module complémentaire pour les machines que vous contrôlez.

Différents agents peuvent-ils utiliser différents modèles ?

Oui : chaque agent peut avoir sa propre valeur par défaut. Les tâches et les discussions peuvent être remplacées pour une seule exécution sans modifier la valeur par défaut globale.

Quelle est la différence entre Sonnet et Opus ?

Opus est conçu pour un raisonnement plus difficile et des plans cohérents à plus long terme ; Sonnet est plus rapide et moins cher pour les boucles d'agents quotidiennes. Les modèles de classe Haiku et Flash sont les meilleurs pour les sous-tâches de volume.

Puis-je exécuter uniquement mon propre modèle et bloquer les API cloud ?

Les espaces de travail d'entreprise peuvent restreindre les fournisseurs de modèles sortants et acheminer tout le trafic des agents vers votre point de terminaison GPU. Le mode hybride est le mode par défaut pour la plupart des équipes.

Quelles tailles de GPU sont disponibles ?

Les offres dépendent de la région et de la demande : généralement des niveaux de VRAM de 24 à 80 Go pour les modèles de classe 7B à 70B et des nœuds multi-GPU pour les piles plus grandes. Nous aidons à dimensionner la VRAM à partir de votre nombre de paramètres et de votre quantification.

L'utilisation d'un GPU privé consomme-t-elle toujours des Digio Tokens ?

L'orchestration (agents, tâches, stockage) reste sur votre forfait. L'inférence sur votre GPU est facturée en temps GPU ; vous pouvez éventuellement mesurer l'utilisation sous forme de jeton pour la rétrofacturation interne.

Choisissez des modèles gérés ou apportez votre GPU

Commencez dès aujourd'hui avec Claude et GPT, puis ajoutez un GPU dédié lorsque vous êtes prêt à héberger des pondérations personnalisées : mêmes agents, mêmes tâches, votre inférence.