← Tutti i servizi

Servizi / Validazione e investigazioni AI

Valutare i modelli.
Ricostruire le azioni.

Per software house e organizzazioni in Svizzera e all’estero: validazione di modelli LLM per chi li addestra e analisi ex-post di sistemi e agenti AI. Il lavoro da remoto dipende dagli accessi e dal perimetro concordati.

01 / AI Validator

Il modello migliora.
Su quali evidenze?

Per team che lavorano su pre-training, fine-tuning o adattamento di dominio. Obiettivi, accesso al modello e profondità delle verifiche vengono definiti insieme.

Benchmark e capacità sul dominio

Definizione di una suite di valutazione con benchmark pertinenti e casi rappresentativi dell’impiego previsto: comprensione, estrazione, ragionamento o generazione, secondo il progetto.

Ricevi
Risultati per compito, lingua e categoria di difficoltà, con metriche concordate e analisi degli errori. Le valutazioni specialistiche richiedono riferimenti validati da esperti di materia.

Confronto tra modelli e checkpoint

Confronto tra modello di base, versioni adattate e candidati al rilascio, mantenendo esplicite e comparabili le condizioni di test.

Ricevi
Un confronto dei miglioramenti e delle regressioni. Le medie aggregate sono accompagnate dai risultati per categoria, per rendere visibili eventuali compromessi.

Accuratezza e allucinazioni

Prove con risposte verificabili per analizzare correttezza, coerenza, aderenza alle istruzioni e comportamento quando mancano informazioni sufficienti.

Ricevi
Errori classificati, esempi documentati e risultati sulle prove eseguite. Eventuali valutatori automatici vengono confrontati con un campione revisionato da persone.

Robustezza e sicurezza del modello

Test concordati su variazioni degli input, istruzioni avversarie, risposte inappropriate e possibili divulgazioni di informazioni sensibili.

Ricevi
Scenari, condizioni ed esiti delle prove, con criticità e priorità. Accesso ai pesi e disponibilità di informazioni sui dati determinano quali verifiche siano possibili.

Qualità del protocollo di valutazione

Esame della separazione tra dati di training e test, della rappresentatività dei campioni e di possibili sovrapposizioni, nei limiti dei materiali disponibili.

Ricevi
Riscontri sui rischi che possono alterare le misure. L’assenza di contaminazione non può essere accertata se i dati di addestramento rilevanti non sono accessibili.

Regressioni prima del rilascio

Riesecuzione delle prove sulle nuove versioni e confronto con soglie di accettazione concordate, documentando modello, prompt, parametri di generazione e ambiente.

Ricevi
Un report di validazione con risultati, variabilità osservata, limiti e punti aperti per la decisione di rilascio del team.

Scenario illustrativo

Il fine-tuning migliora il dominio.
E il resto?

Esempio di valutazione, non un caso cliente.

Una software house adatta un LLM a un settore specifico. Prima del rilascio vuole confrontarlo con il modello di partenza: risponde meglio ai quesiti del dominio? Mantiene le capacità generali? Segue ancora le istruzioni? Introduce nuovi errori?

Una suite concordata misura questi aspetti separatamente. Il report evidenzia dove il nuovo checkpoint migliora, dove regredisce e quali risultati richiedono ulteriori verifiche.

Metodo e consegna

Una validazione tracciabile.

Definire il perimetro

Modello, versione, dominio, lingue, obiettivi e modalità di accesso: endpoint o ambiente concordato.

Preparare il protocollo

Dataset di test, baseline, metriche, criteri di accettazione e condizioni di esecuzione.

Eseguire e analizzare

Test e ripetizioni appropriate, classificazione degli errori e revisione umana dei casi pertinenti.

Consegnare le evidenze

Report comparativo, risultati dettagliati, protocollo e materiali riproducibili previsti dall’incarico.

Un risultato riferito al modello valutato
La validazione riguarda il checkpoint, i compiti e le condizioni documentati. Non costituisce una certificazione normativa né una garanzia per ogni utilizzo. La sicurezza dell’applicazione, dei sistemi RAG o degli agenti che utilizzano il modello richiede un perimetro di verifica distinto.

Per il primo contatto: modello di partenza, tipo di addestramento, dominio, lingue e obiettivo della valutazione. Pesi, dataset proprietari e credenziali vengono condivisi solo con modalità e condizioni concordate.

02 / Analisi forense di incidenti AI

Dal prompt all’azione.
Che cosa è successo?

Analisi ex-post per aziende, software house e studi legali che devono chiarire una risposta problematica, una divulgazione di informazioni o un’operazione inattesa di un sistema AI.

Istruzioni e contesto

Esame dei prompt disponibili, delle istruzioni di sistema, della conversazione e dei contenuti esterni utilizzati dal sistema. Ricerca di possibili istruzioni manipolative o conflitti tra indicazioni.

Azioni proposte, tentate ed eseguite

Correlazione tra risposte, chiamate agli strumenti, esiti delle operazioni e registri dei sistemi coinvolti. Una dichiarazione dell’AI non dimostra da sola che un’azione sia avvenuta.

Permessi e configurazione

Ricostruzione, quando documentabile, di versione del modello, impostazioni, accessi, autorizzazioni e conferme umane. Analisi delle condizioni che hanno reso possibile il comportamento osservato.

Cronologia ed evidenze

Organizzazione temporale degli elementi disponibili, indicazione delle fonti e distinzione tra fatti osservati, ipotesi e lacune. Eventuali riproduzioni vengono concordate in un ambiente controllato.

Il risultato dell’incarico
Un report con cronologia, elementi esaminati, operazioni riscontrate, possibili fattori contribuenti e raccomandazioni pertinenti. Un prompt isolato non basta a stabilire la causa di un incidente; la profondità dell’analisi dipende dalla qualità e disponibilità delle tracce.

Un agente modifica file inattesi.

Scenario illustrativo, non un caso cliente.

Quale richiesta ha ricevuto? Quali contenuti ha consultato? Ha proposto una modifica o l’ha eseguita? Con quali permessi e quali conferme? L’indagine cerca riscontri nei registri disponibili.

Come iniziare

Descrivi l’evento, il periodo e il sistema coinvolto. Indica quali conversazioni e log sono disponibili. Prima di trasferire dati riservati o credenziali, concordiamo materiali, accessi e modalità di condivisione.