Skip to navigation

Provare e mettere a punto

I casi di prova che contano prima di condividerlo
View as Markdown

Un agente si giudica su come si comporta quando la domanda è fatta male, non quando è fatta bene. La prova che conta non è «risponde?» (risponde sempre) ma «si comporta come mi aspetto anche fuori dal caso ideale?»

Per provarlo usi l’Anteprima, la scheda a destra nell’editor: è una chat vera con l’agente, con le sue azioni e la sua conoscenza, e i messaggi non vengono salvati. Nuova chat ricomincia da capo, Usa agente apre la chat completa in una nuova scheda del browser. Su un agente non ancora creato, il primo messaggio che mandi lo crea.

L’Anteprima risponde con la configurazione salvata. Dopo aver cambiato una riga di istruzioni premi Salva, poi riprova. Su un agente già condiviso quel salvataggio vale subito per tutti: per gli esperimenti lavora su una copia, come spiegato in Condividere un agente.

L'Anteprima prima di scrivere: il saluto dell'agente, le frasi di avvio come pulsanti e il campo di scrittura in basso. È la stessa chat che vedranno i colleghi

I quattro casi da fare sempre

La domanda tipica

Quella per cui l’hai costruito. Verifica il contenuto, ma anche il formato: lunghezza, tono, presenza della citazione.

Una a cui non deve rispondere

Fuori perimetro, o dentro il perimetro ma senza risposta nei documenti. Deve dirlo, non inventare né arrangiarsi.

Una scritta male

Tre parole, senza contesto: «e per il lotto 3?». Deve chiedere cosa manca, non tirare a indovinare.

Una che innesca un'azione

Verifica che chieda conferma prima di eseguire e che mostri i valori esatti che sta per usare.

Sono quattro conversazioni, dieci minuti. Sono anche i quattro modi in cui un agente condiviso troppo presto fa fare brutta figura a chi l’ha costruito.

Leggere il risultato

Una risposta va guardata su quattro piani, in quest’ordine.

  1. È vera? Apri le fonti citate e verifica il punto, non il senso generale.
  2. Ha citato? Una risposta corretta senza citazione, su un agente che ha documenti allegati, è un campanello: probabilmente non sta leggendo i tuoi file.
  3. Sta nel perimetro? Se risponde a cose che non gli competono, il problema sono le istruzioni, non il modello.
  4. È utilizzabile così com’è? Lunghezza, tono, struttura. Se la risposta va riscritta ogni volta, l’agente sta facendo metà lavoro.

Dove intervenire

Il riflesso naturale è cambiare modello. Quasi mai è quello il problema.

Cosa vediDove intervenire
Inventa quando non saIstruzioni: aggiungi la frase di ripiego esatta da usare
Risponde ma non cita maiIstruzioni: imponi la citazione. Se non basta, la risposta non veniva dai documenti: chiedi la stessa cosa nominando il file
Non trova un documento che c’èIl file è una scansione senza testo o un formato non leggibile → Formati e limiti
Risponde a domande fuori perimetroIstruzioni, blocco su cosa non deve fare
Risposte troppo lunghe, tono sbagliatoIstruzioni, blocco su come deve rispondere
Alla stessa domanda risponde ogni volta diversoCreatività troppo alta: scendi verso 0.3. Se la variabilità è sul cosa dice quando non sa, aggiungi nelle Istruzioni la frase di ripiego esatta, parola per parola
Sceglie l’azione sbagliataAzioni: ne hai collegate troppe, togli quelle che non servono
Esegue senza chiedere nienteAzioni: attiva Chiedi conferma su quell’azione
Chiede di collegare un accountNormale con le connessioni personali → Connessioni
Ignora uno strumento che gli hai collegato, senza dire nienteLa connessione di quello strumento è scaduta. In chat non compare nessun errore: l’agente si comporta come se quella capacità non esistesse → Connessioni
Il cursore della Creatività portato su 0.3, verso l'estremo Deterministico: è il valore consigliato quando l'agente ha documenti allegati e deve attenersi a quelli

Cambia una cosa alla volta e ripeti la stessa domanda. Se modifichi istruzioni, documenti e creatività insieme e la risposta migliora, non saprai cosa ha funzionato, e alla prossima regressione ricomincerai da capo.

Trasformare le prove in controlli ripetibili

L’Anteprima serve mentre costruisci. Ma le domande importanti vanno verificate di nuovo ogni volta che l’agente cambia, ed è per quello che c’è la scheda Test.

I test mandano al modello solo le Istruzioni e la domanda, con la Creatività dell’agente. Non leggono la conoscenza e non usano azioni né strumenti. Servono quindi a controllare tono, perimetro e frasi di ripiego; per le risposte che dipendono dai documenti la prova si fa nell’Anteprima.

1

Crea un test set

Nuovo test set, poi un nome per un gruppo di casi che riguardano la stessa cosa: Domande base, Casi limite, Cose che non deve dire. Dal menu ⋯ del set puoi rinominarlo o eliminarlo, con tutti i suoi casi.

La scheda Test: il campo del nome aperto da Nuovo test set, con accanto Crea e Annulla, sopra un test set già esistente con i suoi casi
2

Aggiungi i casi

Ogni caso ha tre campi: la Domanda che farai all’agente, la Risposta attesa (com’è fatta una risposta eccellente) e la Valutazione di successo, cioè quando consideri quella risposta un successo. Scrivi in italiano normale: «Deve dire che l’informazione non è nei documenti e non deve proporre alternative.» Invio salva il caso.

Un test set aperto: i casi già salvati in tabella e in fondo la riga nuova con Domanda, Risposta attesa e Valutazione di successo compilate, e la nota Invio per salvare
3

Esegui

Esegui tutti lancia l’intero set. Un giudice AI confronta la risposta ottenuta con quello che hai scritto e motiva il verdetto: sotto ogni caso trovi la risposta reale e la motivazione, così puoi contestarla se il giudizio non ti convince.

Il test set dopo un'esecuzione: Esegui tutti evidenziato in alto, un segno verde accanto ai casi superati e uno rosso su quello fallito, aperto con la risposta ottenuta e la motivazione del giudice
4

Ripeti a ogni modifica

Dopo ogni cambio di istruzioni o di creatività, salva e rilancia il set. È il modo per accorgersi che sistemando una cosa se n’è rotta un’altra. I test li esegue solo chi può modificare l’agente.

I casi migliori da mettere nei test sono quelli che ti hanno già fatto perdere tempo: la domanda su cui l’agente aveva sbagliato, quella a cui non doveva rispondere, quella che nessuno aveva previsto. Un test set di dieci casi ben scelti vale più di cinquanta generici.

Prima di condividerlo

  • I quattro casi base danno risultati che mostreresti a un collega.
  • Le citazioni portano ai documenti giusti.
  • Le azioni che modificano qualcosa chiedono conferma.
  • Il nome e la descrizione dicono a cosa serve, senza bisogno di spiegazioni.
  • Le frasi di avvio mostrano cosa si può chiedere.

Quando queste cinque cose stanno in piedi, è pronto per uscire dal tuo account → Condividere un agente.