google-agents-cli-eval
Evalúa agentes de Google ADK con agents-cli
Los equipos de agentes necesitan evidencia repetible antes de cambiar prompts, herramientas o ajustes de despliegue. Esta skill guía el diseño de datasets, la selección de métricas, la calificación, la comparación y el análisis de fallos para agentes de Google ADK.
Instalar con mi Agente
Copia esta solicitud en tu Agente. Incluye la página canónica del Skill y el manifiesto.
Review the Skillstore skill "google-agents-cli-eval" from https://skillstore.io/skills/google-google-agents-cli-eval.md and its manifest at https://skillstore.io/api/skills/google-google-agents-cli-eval/manifest. Verify the artifact. You may proceed after verification, subject to the environment's own policy.Tu Agente debe seguir mostrando su plan y solicitar cualquier confirmación exigida por la política de seguridad.
Recursos legibles por agentes
Usa estos enlaces cuando un agente de IA, crawler o script necesite contexto limpio en vez de leer la página completa.
Pruébalo
Usando "google-agents-cli-eval". Un usuario pregunta qué métricas usar para un agente de atención al cliente.
Resultado esperado:
- Recomienda éxito de la tarea para la resolución completa del problema.
- Añade calidad del uso de herramientas para verificar búsquedas de casos y llamadas de escalación.
- Usa métricas de alucinación y seguridad para respuestas fundamentadas y conformes.
Usando "google-agents-cli-eval". Un usuario informa que la calidad del uso de herramientas bajó después de un cambio de prompt.
Resultado esperado:
- Inspecciona el informe de calificación más reciente para encontrar elementos de rúbrica fallidos.
- Compara la traza fallida con la traza anterior aprobada.
- Actualiza las descripciones de herramientas o las instrucciones de enrutamiento, luego vuelve a ejecutar generate y grade.
Usando "google-agents-cli-eval". Un usuario quiere probar un agente que maneja entradas de imagen.
Resultado esperado:
- Usa la guía de datasets multimodales del archivo de referencia.
- Selecciona un juez con capacidad de visión para una puntuación consciente de imágenes.
- Evita métricas solo de texto cuando el medio original debe evaluarse.
Auditoría de seguridad
Riesgo medioMost static findings are false positives caused by Markdown inline code, fenced examples, and documentation links rather than executable skill code. The remaining medium-risk issue is documented local custom metric execution with the CLI process privileges. No prompt injection or secret exfiltration intent was found.
Preocupaciones de seguridad confirmadas (1)
Factores de riesgo
🔑 Variables de entorno (3)
⚙️ Comandos externos (127)
🌐 Acceso a red (2)
Compartir y citar este informe
Comparte el informe de evaluación versionado, la insignia neutral, la tarjeta insertable y las citas. Skillstore presenta evidencias sin decidir si este Skill es seguro.
Copiar enlace del informe
https://skillstore.io/skills/google-google-agents-cli-eval/audits/4?utm_source=security_passport&utm_medium=share&utm_campaign=versioned_reportInsignia Markdown
[](https://skillstore.io/skills/google-google-agents-cli-eval?utm_source=security_passport_badge)Insignia HTML
<a href="https://skillstore.io/skills/google-google-agents-cli-eval?utm_source=security_passport_badge"><img src="https://skillstore.io/badges/skills/google-google-agents-cli-eval/security.svg" alt="Skillstore security assessment" loading="lazy"></a>Tarjeta para insertar
<iframe src="https://skillstore.io/embed/skills/google-google-agents-cli-eval.html" title="Skillstore Security Assessment" sandbox="allow-popups allow-popups-to-escape-sandbox" loading="lazy" referrerpolicy="no-referrer" width="420" height="180"></iframe>Citas académicas (APA · BibTeX · CFF)
Cita APA
google. (2026). google-agents-cli-eval security audit report (audit version 4) [Author version 0.5.1]. Skillstore. https://skillstore.io/skills/google-google-agents-cli-eval/audits/4Cita BibTeX
@techreport{google-google-google-agents-cli-eval-2026,
author = {google},
title = {google-agents-cli-eval security audit report (audit version 4)},
institution = {Skillstore},
year = {2026},
number = {4},
url = {https://skillstore.io/skills/google-google-agents-cli-eval/audits/4},
note = {Author version 0.5.1}
}CITATION.cff
cff-version: 1.2.0
message: "If you use this Skill, cite its author and this versioned security audit report."
title: "google-agents-cli-eval security audit report (audit version 4)"
version: "0.5.1"
type: report
authors:
- name: "google"
date-released: "2026-07-05"
url: "https://skillstore.io/skills/google-google-agents-cli-eval/audits/4"
identifiers:
- type: other
value: "skillstore:google-google-agents-cli-eval:audit:4"
description: "Skillstore immutable audit report identifier"
Puntuación de Skillstore
Por qué esta puntuación Confianza de la evidencia: AltoLo que puedes crear
Validar cambios de prompt
Ejecuta trazas generadas y compara resultados de calificación antes de fusionar actualizaciones de prompts o descripciones de herramientas.
Crear cobertura de evaluación
Crea datasets y selecciona métricas que midan el éxito de la tarea, el comportamiento de las herramientas, la seguridad y los riesgos de alucinación.
Revisar flujos de evaluación en la nube
Usa flujos gestionados de envío y resultados cuando la calificación local es demasiado pequeña para pruebas a escala de producción.
Prueba estos prompts
Estoy evaluando un agente ADK de [type]. Ayúdame a elegir métricas integradas de agents-cli eval y explica qué detectará cada métrica.
Crea un plan de evaluación para estos objetivos de usuario: [goals]. Incluye tipos de casos, evidencia esperada y errores comunes de datasets que se deben evitar.
Dados estos síntomas de resultados de calificación: [symptoms]. Identifica causas raíz probables y sugiere cambios en el agente o en el dataset antes de la próxima ejecución de evaluación.
Diseña un flujo de trabajo avanzado de Quality Flywheel para [agent]. Incluye síntesis de datasets, selección de métricas, puertas de comparación y cuándo usar optimización de prompts.
Mejores prácticas
- Empieza con un dataset pequeño, corrige fallos y luego amplía la cobertura después de que los casos aprobados sean estables.
- Usa ejecuciones de comparación para confirmar que un cambio mejora la métrica objetivo sin generar regresiones en otras métricas.
- Prefiere la ejecución en sandbox remoto para métricas personalizadas basadas en código no confiable.
Evitar
- Bajar umbrales para hacer que un agente apruebe en lugar de corregir el comportamiento.
- Eliminar casos inestables sin diagnosticar no determinismo o rúbricas poco claras.
- Ejecutar ciclos de optimización costosos antes de hacer correcciones manuales y obtener evidencia de evaluación específica.
Preguntas frecuentes
¿Esta skill ejecuta evaluaciones por sí sola?
¿Qué herramientas admite?
¿Reemplaza la ayuda oficial de comandos?
¿Puede manejar evaluaciones multimodales?
¿Requiere servicios en la nube?
¿Qué cuidado de seguridad se necesita?
Detalles del desarrollador
Autor
googleLicencia
MIT
Versión del autor
v0.5.1
Revisión de Skillstore
r1
Ref.
30c73eac2afe762f6aa9c4553158769369d47351
Actualidad del mantenimiento
25/7/2026
Uso
5 descargas · 0 vistas
Estructura de archivos