Skip to main content

Google Vertex AI — Inferencia en tu cuenta

Con esta integración, las llamadas a modelos de lenguaje (LLM) de SecureAI se ejecutan en su propio proyecto de Google Cloud en lugar de en los proveedores administrados por SecureAI. El consumo se factura directamente a su cuenta de Google, así que puede aprovechar su gasto comprometido (CUDs) y descuentos negociados. SecureAI sigue en el camino de cada solicitud: DLP, políticas de modelos, residencia de datos y recibos firmados se aplican igual que con cualquier otro proveedor.
No confundir con la otra tarjeta de Google Cloud. Esta página conecta Vertex AI como proveedor de inferencia (Admin → Integraciones → Proveedores de IA). La tarjeta Google Cloud — Descubrimiento (categoría Nube) solo inventaría el proyecto en modo lectura y nunca envía un prompt; se describe en Google Cloud — Descubrimiento. Pueden usarse con el mismo proyecto, pero son independientes y piden permisos distintos.

Qué corre en Vertex y qué no

Modelos disponibles hoy: Gemini y los modelos abiertos servidos como MaaS en Vertex (gpt-oss, DeepSeek, Llama y Qwen). Claude y Mistral en Vertex todavía no están soportados; esos modelos se atienden según la configuración de fallback (ver más abajo).

Requisitos previos

  • Un proyecto de Google Cloud con facturación activa.
  • La Agent Platform API habilitada en ese proyecto (el servicio aiplatform.googleapis.com).
  • Una cuenta de servicio de su proyecto con el rol Agent Platform User (roles/aiplatform.user) y una clave JSON de esa cuenta.
  • Permiso de administrador en la sección Integraciones de SecureAI. Con permiso de lectura puede ver la configuración pero no cambiarla.

Paso 1. Prepare el proyecto en Google Cloud

Puede hacerlo con la línea de comandos (rápido) o desde la consola (con capturas).
Desde Cloud Shell o con gcloud instalado. Reemplace MI_PROYECTO por el ID real del proyecto:
Trate el archivo JSON como una contraseña. SecureAI lo guarda cifrado y no lo vuelve a mostrar, pero el archivo descargado (key.json) queda en su equipo: pegue su contenido en SecureAI y bórrelo después, o guárdelo en un gestor de secretos.
Si no puede crear la clave. Si el paso 4 falla con iam.disableServiceAccountKeyCreation, la política de su organización de Google Cloud prohíbe las claves de cuenta de servicio (es el valor por defecto en organizaciones nuevas). Esta integración necesita la clave JSON, así que un administrador de políticas de la organización debe permitir la creación de claves para ese proyecto (restricción iam.disableServiceAccountKeyCreation) antes de continuar.

Modelos abiertos (Llama, DeepSeek, Qwen, gpt-oss)

Gemini no requiere nada más. Para usar además Llama, DeepSeek, Qwen o gpt-oss, acepte primero los términos de cada modelo en Vertex AI → Model Garden. Estos modelos abiertos necesitan una región concreta (por ejemplo us-central1); con global pueden no estar disponibles.

Paso 2. Conecte el proyecto en SecureAI

  1. Vaya a Administrador → Integraciones, abra la categoría Proveedores de IA y haga clic en la tarjeta Google Vertex AI — Inferencia en tu cuenta.
  2. En Conexión, complete:
    Sección Conexión del panel de Vertex AI
  3. Haga clic en Guardar. Todavía no se enruta tráfico: la integración se guarda apagada para que pueda probarla antes.
Recomendación para el primer día: deje el modo Solo estas familias de modelos con solo Gemini, los modelos por defecto sin cambios y el fallback y las cuotas apagados. Es lo más predecible. Deje Remapear todo para cuando esto ya esté validado.
La clave pegada nunca vuelve a mostrarse. Para reemplazarla, pegue una nueva; si deja el campo vacío al guardar, se conserva la actual.

Paso 3. Elija qué corre en Vertex

En Qué corre en Vertex hay dos modos:
  • Solo estas familias de modelos — las familias que marque (Gemini, gpt-oss, DeepSeek, Llama, Qwen) corren en su Vertex; el resto de los modelos sigue en los proveedores de SecureAI. Es el modo más conservador para empezar (por defecto: solo Gemini).
  • Remapear todo a Vertex — todas las llamadas a LLM corren en su Vertex. Los modelos sin equivalente en Vertex los sirve un modelo por defecto.
Modelos de Vertex por defecto (editables): Además hay dos opciones:
Sección Qué corre en Vertex
Los modelos disponibles dependen de la ubicación. Los modelos por defecto (varios en versión preview) pueden no existir en todas las regiones. Si la prueba de conexión devuelve Modelo no disponible en esta ubicación, elija otra región o reemplace los modelos por defecto por unos que su región sirva. Los modelos abiertos (MaaS) requieren aceptar sus términos en Vertex AI Model Garden y una región concreta.

Paso 4. Pruebe la conexión

  1. Con la integración guardada, en Prueba de conexión haga clic en Probar conexión.
  2. SecureAI envía una solicitud mínima a cada modelo por defecto, por el mismo camino que usará el tráfico real (gateway, políticas y recibos incluidos), y muestra el resultado de cada uno con su latencia.
    Resultado de la prueba de conexión
  3. Si algún modelo falla, el panel indica el motivo. Consulte la sección Solución de problemas al final de esta página.
La prueba envía unas pocas solicitudes de un token y se factura a su cuenta de Google (centavos).

Paso 5. Revise el enrutamiento y active

  1. Abra Vista previa del enrutamiento → Ver qué carril sirve cada modelo. Muestra, para cada modelo del catálogo, si lo servirá su Vertex (y con qué modelo de Vertex) o SecureAI, y cuáles quedarán ocultos para los usuarios. La vista previa simula la integración encendida, así que puede revisar el efecto antes de activarla.
  2. Cuando la prueba pase, encienda Enrutar tráfico a Vertex AI y haga clic en Guardar otra vez. Si no guarda, el interruptor no queda activo. Para activarla se exige tener el proyecto y una credencial configurados.
    Interruptor Enrutar tráfico a Vertex AI activado
  3. La tarjeta pasa a verde: Enrutando a Vertex. Si está guardada pero apagada, muestra en ámbar Configurado · sin enrutamiento a Vertex.
El cambio se aplica de inmediato en el servidor donde se guardó y, a más tardar, en 30 segundos en el resto.

Paso 6. Verifique en el selector de modelos

Cuando la integración está activa, los modelos que corren en su Vertex muestran el logo de Google Cloud junto al nombre en el selector de modelos del chat. Al pasar el mouse indica que corre en la cuenta de Vertex AI de su organización.
Selector de modelos con el logo de Google Cloud
En el modo Remapear todo sin fallback, el selector solo ofrece los modelos que atiende su Vertex. Un modelo sin equivalente quedaría respondido por otro modelo distinto al elegido, y por eso se oculta.

Qué se factura y a quién

  • El consumo de LLM lo factura Google a su cuenta, no SecureAI. Verá el cargo en su facturación de Google Cloud, con sus descuentos y CUDs aplicados.
  • SecureAI muestra el costo de los turnos servidos en Vertex como una estimación a precio de lista solo para analítica. Es una referencia: no incluye sus descuentos, así que la cifra real de Google puede ser menor.
  • Los turnos en Vertex no descuentan puntos de los usuarios, salvo que active Aplicar cuotas de puntos de usuario.

Seguridad y cumplimiento

  • Credenciales cifradas. La clave de la cuenta de servicio se guarda cifrada (AES-256-GCM) y nunca se devuelve al navegador, ni siquiera a un administrador. La pantalla solo muestra el correo de la cuenta.
  • El camino sigue protegido. Cada llamada pasa por el gateway SMLTP de SecureAI: DLP, token de autorización firmado por solicitud y recibo firmado verificable.
  • Residencia de datos. Con una región fija (por ejemplo europe-west4), los prompts se procesan en esa región y se aplican las políticas de residencia de su organización.
  • Falla cerrado. Si no se puede leer la configuración o obtener el token de Google, la solicitud se rechaza; no se envía a otro proveedor salvo que usted haya permitido el fallback.
  • Auditoría. Guardar, probar o desconectar la integración queda en el registro de actividad, con los nombres de los campos cambiados y nunca con la clave.
  • Permisos mínimos. Para inferencia basta roles/aiplatform.user; la integración no necesita leer su IAM ni su facturación.

Desconectar

Desconectar (pie del panel) elimina la configuración y la clave guardada. Desde ese momento, todo el tráfico vuelve a los proveedores administrados por SecureAI. También puede apagar solo el interruptor Enrutar tráfico a Vertex AI para pausar el enrutamiento conservando la conexión. Si dejó de usar la clave, revóquela también en Google Cloud (Cuentas de servicio → Claves).

Solución de problemas

Estos son los motivos que muestra Probar conexión: Errores que pueden ver los usuarios en el chat:

Limitaciones actuales

  • Claude y Mistral en Vertex no están soportados (usan una API distinta).
  • Embeddings, re-ranking, OCR, asistente de administración, generación de imágenes y voz en tiempo real siguen en proveedores administrados por SecureAI.
  • Una sola conexión por organización (un proyecto y una ubicación a la vez).
  • La autenticación es solo con clave JSON de cuenta de servicio.
  • El proxy de Claude Code usa Anthropic de forma directa y no pasa por Vertex.

Relacionado