Nell’ambito di uno studio approfondito, abbiamo effettuato un benchmarking di quattro framework di agenti IA open-source in 2000 iterazioni, esaminando le differenze in termini di latenza, consumo di token ed efficienza architetturale.
LangGraph risulta essere il framework più veloce di tutti, grazie ai tempi di latenza più bassi in tutti i test effettuati, seguito da LangChain, mentre LangGraph e LangChain dimostrano di gestire meglio sia la latenza che il consumo di token.
Questi framework si distinguono tra loro per approcci tecnici diversi che influenzano direttamente le prestazioni e i costi computazionali. AutoGen presenta una buona efficienza in termini di latenza, mentre CrewAI mostra un approccio robusto ma molto più intensivo in termini di token.
Ciclo di Benchmarking
Tra i parametri valutati, il consumo energetico di token emerge come criterio prioritario. L’approccio di LangGraph mostra un vantaggio rispetto agli altri framework, grazie alla sua semplicità tecnica e strutturale, che lo rende ideale per compiti ad alte specifiche e a bassa tolleranza al rischio.
LangChain ha mostrato di essere il framework più efficace in termini di conservazione di token, pur richiedendo un certo aumento di tempo. AutoGen, invece, mostra di gestire i compiti a una velocità simile a CrewAI, pur richiedendo un numero più elevato di token.
CrewAI, da parte sua, si distingue per l’alto consumo complessivo: richiede quasi il triplo dei token rispetto agli altri framework e presenta un tempo di esecuzione più elevato. Questo si deve ai meccanismi di controllo integrati che garantiscono una maggiore completezza nei risultati, a costo di un incremento in risorse.
Sistema di Benchmarking
- LangGraph si distingue per l’approccio innovativo basato su macchine a stati. Questo garantisce una gestione della complessità estremamente efficiente, soprattutto con operazioni semplici.
- LangChain si comporta in modo simile a un codice non agente per compiti elementari, completando i processi in meno di 5 secondi.
- AutoGen, invece, introduce una piccola latenza per via del suo meccanismo di comunicazione tra agenti, un fattore costante che però non compromette molto la sua efficienza.
- CrewAI presenta costanti costi elevati fin dall’attivazione di un singolo strumento, un fattore che si traduce in una velocità di elaborazione molto ridotta e un consumo di token molto alto.
Inoltre, i framework si differenziano non solo per velocità e token, ma anche per struttura: LangGraph, con la sua architettura basata su un grafo, offre il controllo più pulito e affidabile per compiti che richiedono la gestione precisa dello stato.
Test di Complessità
Per analizzare l’interfaccia tra i framework e i linguaggi naturali, abbiamo sottoposto i sistemi a test riguardanti la conversione di frasi descrittive (ad esempio “meno di 1 anno di appartenenza al servizio”) in parametri specifici come “tenuremax=12” o “chargesmin=70.0”.
LangChain e LangGraph hanno entrambi mostrato di conservare fedelmente i parametri generati, senza alterazioni significative. Questo li ha resi i più efficienti per questo test.
AutoGen, invece, ha introdotto un passo in più, un controllo dei parametri prima della loro esecuzione. Sebbene il framework abbia impiegato in media gli stessi tempi e risorse rispetto a LangChain, la presenza di questo passo ha contribuito a un consumo di token leggermente maggiore.
CrewAI, invece, ha richiesto i token più numerosi, quasi 4.360 in media, e ha presentato due tipi distinti di errori: una conversione errata di un valore percentuale e il riposizionamento di un valore di soglia a causa di un ciclo di ripensamento iniziatore da parte del sistema. Questi comportamenti mettono a evidenza la natura non-lineare e ad alto utilizzo di risorse del framework.
Conclusione
LangGraph si conferma il framework più veloce e affidabile in termini di latenza, ma la sua efficienza non è paragonabile alla robustezza di LangChain, che ottiene una buona distribuzione tra latenza e token. AutoGen si posiziona come un compromesso tra velocità e controllo, mentre CrewAI si distingue per la sua struttura complessa e robusta, ma a elevato utilizzo di risorse.
I risultati di questo benchmarking sottolineano l’importanza nella scelta di un framework adatto alle esigenze specifiche. Per il completamento rapido di task semplici, LangGraph si rivela il più efficiente, mentre LangChain presenta un equilibrio ottimale per un’ampia gamma di applicazioni. CrewAI, pur più lento, si dimostra il più adatto per task complessi in cui l’accuratezza prevale sulla velocità. AutoGen, invece, si distingue per l’equilibrio tra latenza, token e controllo, ma non è l’ideale per task estremamente semplici.