infraestructura digital

Modelos de IA y GPU

Ejecute agentes en modelos de frontera administrados hoy mismo, o alquile capacidad de GPU, implemente sus propios pesos y direccione tareas de Digio a puntos finales privados en el mismo espacio de trabajo.

Claude, GPT, Géminis Selección de modelo por agente Alquiler de GPU y BYOM
Modelos gestionados

Modelos disponibles en Digio hoy

Asigne un modelo predeterminado por agente o anule por tarea. El uso se mide en Digio Tokens desde el saldo de su plan: la misma billetera ya sea que el agente llame a Sonnet, GPT-4o o Gemini Flash.

Claude antrópico

  • Claude Opus 4.7 Trabajo emblemático de razonamiento, contexto prolongado, arquitectura y estrategia.
  • Claude Opus 4.6 Opus de generación anterior para análisis estables y de alta calidad.
  • Claude Sonnet 4.6 Controlador diario: codificación, escritura y bucles de agentes de varios pasos.
  • Claude Sonnet 4.5 / 4 Niveles rápidos de Sonnet con almacenamiento en caché rápido en cargas de trabajo compatibles.
  • Claude Haiku 4.5 Borradores de baja latencia, clasificación y subtareas de gran volumen.

AbiertoAI

  • GPT-5.5 / GPT-5.4 / GPT-5.2 La última familia GPT-5 para cargas de trabajo generales y de agencia.
  • GPT-4.1 & GPT-4o Chat multimodal confiable y uso de herramientas para agentes de producción.
  • GPT-4o mini Enrutamiento rentable para resúmenes y pasos ligeros.
  • o3 / o3-pro / o3-mini / o4-mini Modelos centrados en el razonamiento para matemáticas, planificación y verificación.
  • GPT-5.3 Codex & Codex mini Generación de código, refactores y habilidades de agente con reconocimiento de repositorios.

Google Géminis

  • Gemini 2.5 Pro Investigación de contexto largo y extracción estructurada.
  • Gemini 2.5 Flash Pasos de agente de alto rendimiento con tasas de token competitivas.
  • Gemini 2.0 Flash Pases ultrarrápidos para análisis, etiquetado y trabajos por lotes.

API abiertas y especializadas

  • DeepSeek Chat & Reasoner Gran valor para tareas de chat y estilo cadena de pensamiento.
  • Mistral Large Opción alojada en Europa para equipos de agentes multilingües.
  • Llama 3.3 70B Modelo de clase de pesos abiertos a través de API: combina bien con GPU privada.
  • Grok 3 Modelo orientado en tiempo real para agentes de noticias y seguimiento social.
  • Sonar Pro Respuestas basadas en la búsqueda para agentes de investigación.
  • Command R+ Flujos de trabajo de recuperación y chat empresarial compatibles con RAG.

Model list and token economics evolve with provider releases. Your workspace shows live options when you assign a model to an agent; Digio Tokens debit from the same balance as in pricing.

Uso

Cómo los agentes eligen un modelo

El Coordinador puede recomendar Sonnet, Opus o un modelo flash más económico según el tipo de tarea. Los usuarios avanzados establecen valores predeterminados por función de agente: investigación en Sonnet, revisión final en Opus, etiquetado masivo en Haiku o Gemini Flash.

  • Per agent — default model in agent settings; override in To do or chat when needed.

  • Metered fairly — input, output, and cached tokens map to Digio Token charges (see usage in your wallet).

  • Skills stay the same — tools and integrations work across models; only latency and cost profile change.

  • Plan limits — more agents and monthly Digio Tokens on higher tiers; top up anytime on the pricing page.

alquiler de GPU

Alquila GPU y ejecuta tus propios modelos

¿Necesita un ajuste, un punto de control aislado o precios de inferencia predecibles? Agregue capacidad de GPU dedicada a su espacio de trabajo de Digio, instale la pila de servicio que prefiera y dirija a los agentes a su punto final privado.

Instancias dedicadas

Nodos de GPU por hora o por mes (clase A100, H100, L40S) conectados a su inquilino, aislados de otros clientes.

Tus pesas

Cargue tensores de seguridad, GGUF o extráigalos de su registro; ejecute Llama, Mistral, Qwen y ajustes personalizados.

Porción estándar

vLLM, TGI, Ollama o imágenes de contenedor que usted mantiene: los agentes de Digio llaman a una URL base compatible con OpenAI.

Misma orquestación

Las tareas pendientes, el chat en equipo, las habilidades y la colaboración no cambian: solo el backend de inferencia es tuyo.

Enrutamiento híbrido

Envíe pasos confidenciales a una GPU privada y utilice Claude o GPT para investigaciones públicas en un solo flujo de trabajo.

Controles empresariales

Emparejamiento de VPC, salida estática, registros de auditoría y listas de modelos permitidos para equipos regulados.

Trae tu propio modelo

Instalar y conectar un modelo personalizado

Configuración típica desde cero para que los agentes llamen a su punto final:

  1. Reservar GPU

    Elija VRAM, región y tiempo de actividad (ráfaga o siempre activa). El almacenamiento para pesas se envía con la instancia o se monta en su cubo.

  2. Implementar la pila

    Inicie una imagen de servicio o SSH, instale controladores CUDA y cargue puntos de control. Los controles de salud confirman que el modelo está listo.

  3. Registrar punto final

    Agregue la URL base, la clave API y la identificación del modelo en la configuración del espacio de trabajo. Digio valida la latencia y el formato del token antes de publicarse.

  4. Asignar a agentes

    Elija su modelo privado como predeterminado para los agentes seleccionados; Los modelos gestionados Claude/GPT siguen estando disponibles uno al lado del otro.

El alquiler de GPU se factura por separado de las suscripciones al plan Digio. Contáctenos para planificación de capacidad, SLA y migración desde un clúster de inferencia existente.

Preguntas frecuentes

Preguntas sobre modelos y GPU

Elegir API administradas versus inferencia autohospedada en Digio.

¿Pago dos veces: plan más API?

Su suscripción a Digio cubre infraestructura, agentes y tokens Digio incluidos. Débitos de uso del modelo administrado que equilibran los tokens con los tokens de entrada/salida reales. El alquiler de GPU es un complemento para las máquinas que controlas.

¿Pueden diferentes agentes utilizar diferentes modelos?

Sí, cada agente puede tener su propio valor predeterminado. Las tareas y los chats se pueden anular para una sola ejecución sin cambiar el valor predeterminado global.

¿Cuál es la diferencia entre Soneto y Opus?

Opus está preparado para razonamientos más estrictos y planes más largos y coherentes; Sonnet es más rápido y económico para los bucles de agentes cotidianos. Los modelos Haiku y flash son mejores para subtareas de volumen.

¿Puedo ejecutar solo mi propio modelo y bloquear las API de la nube?

Los espacios de trabajo empresariales pueden restringir los proveedores de modelos salientes y enrutar todo el tráfico de los agentes a su punto final de GPU. El modo híbrido es el predeterminado para la mayoría de los equipos.

¿Qué tamaños de GPU están disponibles?

Las ofertas dependen de la región y la demanda: normalmente niveles de VRAM de 24 a 80 GB para modelos de clase 7B a 70B y nodos de múltiples GPU para pilas más grandes. Ayudamos a dimensionar la VRAM a partir del recuento y cuantificación de sus parámetros.

¿El uso privado de GPU todavía consume tokens Digio?

La orquestación (agentes, tareas, almacenamiento) permanece en su plan. La inferencia en su GPU se factura como tiempo de GPU; Opcionalmente, puede medir el uso en forma de token para contracargos internos.

Elija modelos administrados o traiga su GPU

Comience con Claude y GPT hoy, luego agregue GPU dedicada cuando esté listo para albergar ponderaciones personalizadas: los mismos agentes, las mismas tareas, su inferencia.