Capítulo 17 — Ingeniería de Costo
TL;DR: Un agente ejecutándose 1 millón de veces por mes no es barato por defecto. Ingeniería de costo es sobre hacer que cada token cuente.
Ejes de optimización
Sección titulada «Ejes de optimización»- Reducir tokens por turno — cache de prompt, resúmenes, context pruning
- Modelar más barato — Haiku vs Sonnet vs Opus
- Batch + defer — agrupa solicitudes offline cuando sea posible
// Antes: cache desactivadoasync function agentExpensive(query: string) { return await llm.generate({prompt: systemPrompt + query});}
// Después: cache activado, contexto podadoasync function agentOptimized(userId: string, query: string) { const cached = { type: "text", text: systemPrompt, cache_control: { type: "ephemeral" } };
const profile = await pruneProfile(userId); // resumen, no completo
return await llm.generate({ messages: [ {role: "user", content: [cached, {type: "text", text: profile + query}]} ] });}