Contabilidad de costes de API de un agente financiero

Updated 2026-09-05

Mide el trabajo completo de investigación, no una respuesta. Une el uso del modelo con el procesamiento de fuentes, el cálculo cuantitativo y los resultados de revisión antes de comparar flujos.

Elige la unidad de trabajo antes de estimar el coste

Define si mides un informe de una empresa, una comparación de resultados, una actualización de lista de seguimiento o un experimento cuantitativo. Una aplicación multiagente puede realizar muchas solicitudes al modelo dentro de esa unidad. Separa las tareas que terminaron técnicamente de los artefactos aceptados por un revisor. El coste por artefacto aceptado captura reintentos y trabajo rechazado que una métrica de coste por respuesta no ve. Mantén estable la definición de tarea al comparar modelos; de lo contrario, una ejecución más barata puede simplemente haber leído menos fuentes u omitido una etapa de revisión obligatoria.

Flujo de trabajo de investigación financiera: recopilar fuentes públicas, extraer hechos, calcular y conciliar, generar explicaciones con citas y revisar el resultado.
Ilustración del flujo de trabajo. La investigación y la revisión vinculadas a las fuentes son independientes de la ejecución de operaciones.

Mantén un registro de solicitudes unido al trabajo

Registra la identidad del trabajo, la etapa, la función del modelo, el modelo solicitado, la identidad de solicitud observada, el número de intento y el estado final. Conserva el uso de tokens y el registro de facturación aplicable cuando estén disponibles. Un timeout del cliente no demuestra que no hubiera cálculo ni que la solicitud fuera gratuita. Mantén un estado de facturación sin resolver hasta poder conciliarlo. Nunca introduzcas claves, prompts privados o documentos completos de fuentes con licencia en un registro de costes que se vaya a compartir con una audiencia más amplia.

{
  "job_id": "REQUIRED",
  "stage": "research_synthesis",
  "model_role": "review",
  "requested_model": "CURRENT_CATALOG_MODEL_ID",
  "request_id": null,
  "attempt": 1,
  "input_tokens": null,
  "output_tokens": null,
  "charge": null,
  "billing_status": "unreconciled",
  "artifact_status": "pending"
}

Aplica el contrato de facturación real

Usa la fuente de precios actual para el modelo seleccionado y registra su versión o fecha de recuperación junto a la estimación. Distingue la entrada normal, la entrada en caché, la salida y cualquier otra categoría facturada según ese contrato. No cuentes dos veces un subconjunto en caché ya incluido en la entrada total. Los precios oficiales del proveedor y los cargos del gateway son contratos diferentes; ninguno debe sustituir silenciosamente al otro. Si una respuesta no contiene uso, usa evidencia de facturación autoritativa cuando esté disponible y conserva la incertidumbre hasta entonces.

Elemento de costeEvidencia que conservarError habitual
Solicitud al modeloCategorías de uso e importe facturadoAplicar un precio de otro proveedor
ReintentoIntento e identidad de la solicitud principalEliminar intentos fallidos pero facturados
CachéSemántica de caché y categoría facturadaSuponer que la reutilización local es un descuento de facturación
EmbeddingModelo, alcance de entrada y cargoContarlo como chat normal
Solicitud sin resolverEstado y tarea de conciliaciónSustituir el coste desconocido por cero

Contabiliza las partes no LLM de la investigación financiera

Añade el acceso a datos financieros, la extracción documental, el almacenamiento, el cálculo local y la revisión humana como categorías separadas. Un experimento de Qlib o una ejecución de entrenamiento de FinRL puede consumir recursos importantes sin realizar una solicitud de chat. Un notebook de FinGPT puede combinar conversación remota de un agente con inferencia local de sentimiento. Mantener esas rutas diferenciadas explica dónde puede ayudar la optimización. Al informar de costes compartidos de suscripción o infraestructura, indica el método de asignación en lugar de fingir que cada tarea generó un cargo facturado de forma independiente.

Comprende por qué los costes multiagente se multiplican

TradingAgents tiene funciones de modelo y etapas de investigación iterativas separadas; el total depende del volumen real de fuentes y de las rondas configuradas. Otros frameworks añaden coordinación, recuperación, reintentos o revisiones repetidas de código. Cuenta estas operaciones a partir de los logs en lugar de estimarlas por el número de agentes nombrados. El mismo informe largo puede repetirse en varios prompts. Inspecciona dónde se reutiliza el contexto y si cada revisión adicional aporta un beneficio de aceptación distinto. Un grafo mayor no es automáticamente un flujo de investigación más económico o preciso.

Reduce el trabajo repetido conservando la evidencia

Extrae los documentos una vez por fuente y versión del parser y pasa después paquetes de evidencia acotados a las etapas posteriores. Reutiliza los cálculos deterministas según la identidad de entrada y fórmula. Limita las rondas de debate y los intentos de reintento y elige las funciones del modelo según los requisitos reales de la tarea. Valida el efecto en la salida aceptada, no solo en el número de solicitudes. Un resumen agresivo puede omitir la salvedad más importante; la reutilización de caché puede servir un informe obsoleto. Toda optimización necesita una forma de detectar entradas desactualizadas y conservar la fuente original para revisión.

Compara los flujos con el mismo paquete de tarea

Usa el mismo conjunto de emisores, corte, paquete de fuentes y criterios de aceptación. Registra los artefactos completados, los rechazados, los trabajos parciales y las correcciones humanas. Compara la distribución resultante de costes de tareas en lugar de seleccionar una ejecución favorable. Para una lista de seguimiento programada, separa los eventos sin cambios de los eventos con fuente nueva porque su trabajo es diferente. Para investigación cuantitativa, incluye el número de hipótesis intentadas y el cálculo local. Publica la configuración y los límites de evidencia junto a cualquier cifra medida posterior para que otro revisor pueda saber qué cubre realmente la comparación.

Estado de evidencia y medición

Esta página proporciona un método contable, no un precio medido por informe ni una tabla actual de precios de modelos. Las fuentes oficiales de los proyectos establecen las distintas responsabilidades de ejecución; la página de precios actual proporciona las condiciones comerciales. Para esta guía no se generó ningún registro de uso de un flujo financiero de APIsRouter. Un caso medido debe incluir evidencia redactada de solicitudes, cargos conciliados, costes de recursos no relacionados con el modelo y el número de artefactos aceptados.

Preguntas frecuentes

¿Cuánto cuesta un análisis de TradingAgents?

Depende de los modelos reales, el volumen de fuentes, las rondas y los reintentos. Ejecuta una tarea acotada y concilia su registro de solicitudes en lugar de suponer una cifra universal por análisis.

¿Deben contarse las solicitudes fallidas?

Inclúyelas cuando la evidencia de facturación muestre un cargo. Mantén los intentos inciertos sin resolver hasta conciliarlos en lugar de asignarles coste cero.

¿La caché de la aplicación reduce el precio del proveedor?

No necesariamente. Puede evitar por completo una solicitud, mientras que la prompt caching del proveedor tiene su propia semántica de facturación. Registra qué mecanismo ocurrió realmente.

¿Los costes de Qlib y FinRL forman parte de la factura de API?

Su cálculo central es una categoría de recursos separada. Un agente LLM conectado también puede generar cargos de API, que deben unirse mediante la identidad del experimento.

¿Cuál es el denominador más justo para comparar?

Usa un artefacto o experimento aceptado claramente definido, con los intentos fallidos y el trabajo de revisión incluidos según un método de asignación declarado.