Strategia di intelligenza artificiale del gruppo BPCE

Con più di 100 000 collaboratori e 35 milioni di clienti, BPCE (Banque Populaire Caisse d’Épargne) è il secondo gruppo bancario francese. La sua strategia IA si articola su due pilastri fondamentali. Da un lato, l’iniziativa “IA per tutti” prevede Maia, un assistente virtuale simile a ChatGPT, sviluppato interamente in house e progettato per garantire sicurezza e riservatezza dei dati. Dall’altro, BPCE investe in soluzioni IA trasformative rivolte a consulenti, centri di contatto, esperienze digitali dei clienti e ai dipartimenti IT, con applicazioni specifiche per ciascuna funzione.

Modelli di linguaggio di grandi dimensioni (LLM) a disposizione

Per supportare questa doppia strategia, BPCE mette a disposizione dei propri team una serie di LLM provenienti da fornitori leader a livello mondiale. La scelta dei provider è stata guidata dalla necessità di coprire diverse esigenze di capacità computazionale, costi operativi e compliance normativa.

    • Anthropic – modello di generazione testo con forte attenzione alla sicurezza.
    • OpenAI – ChatGPT e varianti ottimizzate per risposte rapide.
    • Mistral – modello europeo focalizzato su efficienza energetica.
    • Google (GCP) – modelli integrati nella piattaforma Cloud di Google.
    • Alibaba (Azure) – offerta orientata al mercato asiatico e a soluzioni ibride.

Tutti questi modelli sono esposti sia su infrastrutture Azure che Google Cloud Platform (GCP) del gruppo, con alcune installazioni on‑premise per rispondere a requisiti di sovranità dei dati.

Architettura unificata mediante API interna

Come spiegato da Mikaël Le Bars, leader dell’entità Expertises Transverses IA, BPCE ha sviluppato una strato API interno che funge da unico endpoint per accedere a tutti i LLM citati. Questa architettura consente ai team di sviluppo di invocare, con una sola chiamata, il modello più adatto al caso d’uso, senza doversi preoccupare delle specifiche di ciascun provider.

Il bisogno di un benchmark interno

Il rapido evolversi dei prodotti IA gestiti ha evidenziato una lacuna: i benchmark pubblici tradizionali, spesso basati su task generici, non riflettono le sfide concrete del settore bancario. Sara Meftah, senior manager e ricercatrice IA presso Square Management, ha sottolineato due osservazioni cruciali: “Il prodotto usato dalla banca cambia silenziosamente, e l’offerta LLM si evolve costantemente”. Di conseguenza, BPCE ha avviato un progetto interno per valutare sistematicamente le performance dei modelli rispetto a requisiti specifici.

Definizione del perimetro e delle metriche

Il percorso di benchmarking è stato strutturato in tre fasi principali: cadratura, implementazione e deployment. Durante la fase di cadratura, il team ha identificato:

    • I perimetri di business da valutare (es. chatbot, rilevazione di intenti, traduzione).
    • I dataset disponibili all’interno del gruppo, sia già etichettati sia da etichettare.
    • Le metriche chiave da utilizzare per ogni task.

Il risultato è stato un inventario dettagliato di “competenze” richieste per ciascun progetto, suddivise in sotto‑task più granulari, così da poter misurare ogni aspetto in modo isolato.

Esempi di competenze e task

    • Modera­zione del contenuto per chatbot.
    • Rilevamento delle intenzioni dell’utente.
    • Traduzione automatica di documenti bancari.
    • Classificazione di termini finanziari (Term Error Rate).
    • Generazione di sintesi per report di credito.

Dataset, etichettatura e labellizzazione

Un ostacolo significativo è stato rappresentato dalla preparazione dei dataset. Il gruppo ha dovuto:

    • Raccogliere dati provenienti da progetti in produzione, proof‑of‑concept (PoC) e fasi di ideazione.
    • Effettuare un lavoro di etichettatura manuale per garantire la qualità delle ground truth.
    • Normalizzare formati diversi per creare un repository centralizzato accessibile a tutti i modelli.

Questo lavoro ha richiesto la collaborazione di più dipartimenti, inclusi data science, compliance e business unit, per assicurare che le informazioni sensibili fossero trattate secondo le normative vigenti.

Set di indicatori chiave di performance (KPI)

Per ogni task, il team ha definito una serie di KPI, alcuni “state‑of‑the‑art” e altri specifici per il contesto bancario. Tra i più rilevanti troviamo:

    • Latency (ms) – tempo medio di risposta per query tipiche.
    • Cost per 1 000 token – valutazione economica dell’utilizzo.
    • Robustness score – capacità del modello di gestire input rumorosi o ambigui.
    • Term Error Rate (TER) – tasso di errore nella rilevazione di termini finanziari.
    • Precision/Recall per intent detection – accuratezza nella comprensione delle richieste dei clienti.

Queste metriche sono state integrate in dashboard interne, consentendo un monitoraggio continuo e una comparazione trasparente tra i diversi LLM.

Risultati preliminari e osservazioni contro‑intuitive

I test hanno rivelato alcuni risultati inaspettati. Per esempio, il modello di Anthropic, pur avendo un costo unitario più elevato, ha mostrato la latenza più bassa nelle operazioni di moderazione, grazie a ottimizzazioni specifiche per contenuti sensibili. Al contrario, il modello di OpenAI, sebbene più rapido in scenari generali, ha avuto difficoltà a mantenere un TER accettabile quando si trattava di termini tecnici bancari non standard.

Inoltre, i modelli on‑premise hanno dimostrato una maggiore robustezza rispetto alle versioni cloud, riducendo gli errori legati a fluttuazioni