El artículo explica el mecanismo fundamental para transformar un modelo de lenguaje en un agente autónomo mediante la técnica de 'tool calling'. A diferencia de las creencias populares, el modelo no ejecuta código ni posee memoria interna; su única función es generar texto. La clave reside en una estructura de cuatro pasos: el usuario define una función, la describe en JSON Schema para que el modelo la entienda, el sistema envía el mensaje inicial y el modelo responde. Si la respuesta contiene una solicitud de herramienta, el sistema la ejecuta y devuelve el resultado al modelo para la siguiente iteración. Este ciclo se repite hasta que el modelo responde sin solicitar más acciones.
El texto detalla la implementación en JavaScript y Python, destacando que el modelo emite argumentos estructurados en JSON que deben parsearse, no tratarse como texto plano. Un aspecto crítico es la gestión de la memoria: el modelo no recuerda conversaciones anteriores, por lo que el historial de mensajes se envía completo en cada turno. Esto genera un coste significativo, ya que cada solicitud reenvía todo el contexto. Por ejemplo, un archivo de 8.000 tokens enviado una vez puede duplicar el coste de entrada en las siguientes ocho iteraciones. La lección concluye que la optimización debe centrarse en reducir el tamaño de los resultados de las herramientas y utilizar el control de caché para el prefijo de la conversación, en lugar de intentar reducir el prompt inicial, que solo se envía una vez.
