Google Vertex AI — Inferencia en tu cuenta
Con esta integración, las llamadas a modelos de lenguaje (LLM) de SecureAI se ejecutan en su propio proyecto de Google Cloud en lugar de en los proveedores administrados por SecureAI. El consumo se factura directamente a su cuenta de Google, así que puede aprovechar su gasto comprometido (CUDs) y descuentos negociados. SecureAI sigue en el camino de cada solicitud: DLP, políticas de modelos, residencia de datos y recibos firmados se aplican igual que con cualquier otro proveedor.No confundir con la otra tarjeta de Google Cloud. Esta página conecta Vertex AI como proveedor de inferencia (Admin → Integraciones → Proveedores de IA). La tarjeta Google Cloud — Descubrimiento (categoría Nube) solo inventaría el proyecto en modo lectura y nunca envía un prompt; se describe en Google Cloud — Descubrimiento. Pueden usarse con el mismo proyecto, pero son independientes y piden permisos distintos.
Qué corre en Vertex y qué no
Modelos disponibles hoy: Gemini y los modelos abiertos servidos como MaaS en Vertex (gpt-oss, DeepSeek, Llama y Qwen). Claude y Mistral en Vertex todavía no están soportados; esos modelos se atienden según la configuración de fallback (ver más abajo).
Requisitos previos
- Un proyecto de Google Cloud con facturación activa.
- La Agent Platform API habilitada en ese proyecto (el servicio
aiplatform.googleapis.com). - Una cuenta de servicio de su proyecto con el rol Agent Platform User (
roles/aiplatform.user) y una clave JSON de esa cuenta. - Permiso de administrador en la sección Integraciones de SecureAI. Con permiso de lectura puede ver la configuración pero no cambiarla.
Paso 1. Prepare el proyecto en Google Cloud
Puede hacerlo con la línea de comandos (rápido) o desde la consola (con capturas).- gcloud (Cloud Shell)
- Consola de Google Cloud
Desde Cloud Shell o con
gcloud instalado. Reemplace MI_PROYECTO por el ID real del proyecto:Modelos abiertos (Llama, DeepSeek, Qwen, gpt-oss)
Gemini no requiere nada más. Para usar además Llama, DeepSeek, Qwen o gpt-oss, acepte primero los términos de cada modelo en Vertex AI → Model Garden. Estos modelos abiertos necesitan una región concreta (por ejemplous-central1); con global pueden no estar disponibles.
Paso 2. Conecte el proyecto en SecureAI
- Vaya a Administrador → Integraciones, abra la categoría Proveedores de IA y haga clic en la tarjeta Google Vertex AI — Inferencia en tu cuenta.
-
En Conexión, complete:

- Haga clic en Guardar. Todavía no se enruta tráfico: la integración se guarda apagada para que pueda probarla antes.
Recomendación para el primer día: deje el modo Solo estas familias de modelos con solo Gemini, los modelos por defecto sin cambios y el fallback y las cuotas apagados. Es lo más predecible. Deje Remapear todo para cuando esto ya esté validado.
La clave pegada nunca vuelve a mostrarse. Para reemplazarla, pegue una nueva; si deja el campo vacío al guardar, se conserva la actual.
Paso 3. Elija qué corre en Vertex
En Qué corre en Vertex hay dos modos:- Solo estas familias de modelos — las familias que marque (Gemini, gpt-oss, DeepSeek, Llama, Qwen) corren en su Vertex; el resto de los modelos sigue en los proveedores de SecureAI. Es el modo más conservador para empezar (por defecto: solo Gemini).
- Remapear todo a Vertex — todas las llamadas a LLM corren en su Vertex. Los modelos sin equivalente en Vertex los sirve un modelo por defecto.
Además hay dos opciones:

Los modelos disponibles dependen de la ubicación. Los modelos por defecto (varios en versión preview) pueden no existir en todas las regiones. Si la prueba de conexión devuelve Modelo no disponible en esta ubicación, elija otra región o reemplace los modelos por defecto por unos que su región sirva. Los modelos abiertos (MaaS) requieren aceptar sus términos en Vertex AI Model Garden y una región concreta.
Paso 4. Pruebe la conexión
- Con la integración guardada, en Prueba de conexión haga clic en Probar conexión.
-
SecureAI envía una solicitud mínima a cada modelo por defecto, por el mismo camino que usará el tráfico real (gateway, políticas y recibos incluidos), y muestra el resultado de cada uno con su latencia.

- Si algún modelo falla, el panel indica el motivo. Consulte la sección Solución de problemas al final de esta página.
La prueba envía unas pocas solicitudes de un token y se factura a su cuenta de Google (centavos).
Paso 5. Revise el enrutamiento y active
- Abra Vista previa del enrutamiento → Ver qué carril sirve cada modelo. Muestra, para cada modelo del catálogo, si lo servirá su Vertex (y con qué modelo de Vertex) o SecureAI, y cuáles quedarán ocultos para los usuarios. La vista previa simula la integración encendida, así que puede revisar el efecto antes de activarla.
-
Cuando la prueba pase, encienda Enrutar tráfico a Vertex AI y haga clic en Guardar otra vez. Si no guarda, el interruptor no queda activo. Para activarla se exige tener el proyecto y una credencial configurados.

- La tarjeta pasa a verde: Enrutando a Vertex. Si está guardada pero apagada, muestra en ámbar Configurado · sin enrutamiento a Vertex.
Paso 6. Verifique en el selector de modelos
Cuando la integración está activa, los modelos que corren en su Vertex muestran el logo de Google Cloud junto al nombre en el selector de modelos del chat. Al pasar el mouse indica que corre en la cuenta de Vertex AI de su organización.
Qué se factura y a quién
- El consumo de LLM lo factura Google a su cuenta, no SecureAI. Verá el cargo en su facturación de Google Cloud, con sus descuentos y CUDs aplicados.
- SecureAI muestra el costo de los turnos servidos en Vertex como una estimación a precio de lista solo para analítica. Es una referencia: no incluye sus descuentos, así que la cifra real de Google puede ser menor.
- Los turnos en Vertex no descuentan puntos de los usuarios, salvo que active Aplicar cuotas de puntos de usuario.
Seguridad y cumplimiento
- Credenciales cifradas. La clave de la cuenta de servicio se guarda cifrada (AES-256-GCM) y nunca se devuelve al navegador, ni siquiera a un administrador. La pantalla solo muestra el correo de la cuenta.
- El camino sigue protegido. Cada llamada pasa por el gateway SMLTP de SecureAI: DLP, token de autorización firmado por solicitud y recibo firmado verificable.
- Residencia de datos. Con una región fija (por ejemplo
europe-west4), los prompts se procesan en esa región y se aplican las políticas de residencia de su organización. - Falla cerrado. Si no se puede leer la configuración o obtener el token de Google, la solicitud se rechaza; no se envía a otro proveedor salvo que usted haya permitido el fallback.
- Auditoría. Guardar, probar o desconectar la integración queda en el registro de actividad, con los nombres de los campos cambiados y nunca con la clave.
- Permisos mínimos. Para inferencia basta
roles/aiplatform.user; la integración no necesita leer su IAM ni su facturación.
Desconectar
Desconectar (pie del panel) elimina la configuración y la clave guardada. Desde ese momento, todo el tráfico vuelve a los proveedores administrados por SecureAI. También puede apagar solo el interruptor Enrutar tráfico a Vertex AI para pausar el enrutamiento conservando la conexión. Si dejó de usar la clave, revóquela también en Google Cloud (Cuentas de servicio → Claves).Solución de problemas
Estos son los motivos que muestra Probar conexión:
Errores que pueden ver los usuarios en el chat:
Limitaciones actuales
- Claude y Mistral en Vertex no están soportados (usan una API distinta).
- Embeddings, re-ranking, OCR, asistente de administración, generación de imágenes y voz en tiempo real siguen en proveedores administrados por SecureAI.
- Una sola conexión por organización (un proyecto y una ubicación a la vez).
- La autenticación es solo con clave JSON de cuenta de servicio.
- El proxy de Claude Code usa Anthropic de forma directa y no pasa por Vertex.
Relacionado
- Google Cloud — Descubrimiento — inventario de agentes, modelos, identidades y costos del proyecto.
- Descripción general de los proveedores de IA en la nube
- Recibos firmados





