Provare e mettere a punto
Un agente si giudica su come si comporta quando la domanda è fatta male, non quando è fatta bene. La prova che conta non è «risponde?» (risponde sempre) ma «si comporta come mi aspetto anche fuori dal caso ideale?»
Per provarlo usi l’Anteprima, la scheda a destra nell’editor: è una chat vera con l’agente, con le sue azioni e la sua conoscenza, e i messaggi non vengono salvati. Nuova chat ricomincia da capo, Usa agente apre la chat completa in una nuova scheda del browser. Su un agente non ancora creato, il primo messaggio che mandi lo crea.
L’Anteprima risponde con la configurazione salvata. Dopo aver cambiato una riga di istruzioni premi Salva, poi riprova. Su un agente già condiviso quel salvataggio vale subito per tutti: per gli esperimenti lavora su una copia, come spiegato in Condividere un agente.
I quattro casi da fare sempre
Sono quattro conversazioni, dieci minuti. Sono anche i quattro modi in cui un agente condiviso troppo presto fa fare brutta figura a chi l’ha costruito.
Leggere il risultato
Una risposta va guardata su quattro piani, in quest’ordine.
- È vera? Apri le fonti citate e verifica il punto, non il senso generale.
- Ha citato? Una risposta corretta senza citazione, su un agente che ha documenti allegati, è un campanello: probabilmente non sta leggendo i tuoi file.
- Sta nel perimetro? Se risponde a cose che non gli competono, il problema sono le istruzioni, non il modello.
- È utilizzabile così com’è? Lunghezza, tono, struttura. Se la risposta va riscritta ogni volta, l’agente sta facendo metà lavoro.
Dove intervenire
Il riflesso naturale è cambiare modello. Quasi mai è quello il problema.
Cambia una cosa alla volta e ripeti la stessa domanda. Se modifichi istruzioni, documenti e creatività insieme e la risposta migliora, non saprai cosa ha funzionato, e alla prossima regressione ricomincerai da capo.
Trasformare le prove in controlli ripetibili
L’Anteprima serve mentre costruisci. Ma le domande importanti vanno verificate di nuovo ogni volta che l’agente cambia, ed è per quello che c’è la scheda Test.
I test mandano al modello solo le Istruzioni e la domanda, con la Creatività dell’agente. Non leggono la conoscenza e non usano azioni né strumenti. Servono quindi a controllare tono, perimetro e frasi di ripiego; per le risposte che dipendono dai documenti la prova si fa nell’Anteprima.
Crea un test set
Nuovo test set, poi un nome per un gruppo di casi che riguardano la stessa cosa: Domande base, Casi limite, Cose che non deve dire. Dal menu ⋯ del set puoi rinominarlo o eliminarlo, con tutti i suoi casi.

Aggiungi i casi
Ogni caso ha tre campi: la Domanda che farai all’agente, la Risposta attesa (com’è fatta una risposta eccellente) e la Valutazione di successo, cioè quando consideri quella risposta un successo. Scrivi in italiano normale: «Deve dire che l’informazione non è nei documenti e non deve proporre alternative.» Invio salva il caso.

I casi migliori da mettere nei test sono quelli che ti hanno già fatto perdere tempo: la domanda su cui l’agente aveva sbagliato, quella a cui non doveva rispondere, quella che nessuno aveva previsto. Un test set di dieci casi ben scelti vale più di cinquanta generici.
Prima di condividerlo
- I quattro casi base danno risultati che mostreresti a un collega.
- Le citazioni portano ai documenti giusti.
- Le azioni che modificano qualcosa chiedono conferma.
- Il nome e la descrizione dicono a cosa serve, senza bisogno di spiegazioni.
- Le frasi di avvio mostrano cosa si può chiedere.
Quando queste cinque cose stanno in piedi, è pronto per uscire dal tuo account → Condividere un agente.


