Progetti che hanno ottenuto una promozione 16.10.2025
IdiomVoice - progetto per la digitalizzazione della lingua romancia
Il progetto di ricerca contribuisce alla digitalizzazione della lingua romancia creando un modello linguistico (large language model) basato sull'intelligenza artificiale (IA), dapprima per il sursilvan. In questo modo la SUP GR può posizionarsi come esperta per modelli linguistici basati su piccoli set di dati, procurarsi fondi per la ricerca tramite progetti successivi e creare posti di lavoro a lungo termine nel settore della ricerca applicata e dell'IA.
Informazioni principali in sintesi
- Richiedenti: Fachhochschule Graubünden (FHGR)
- Approvato dal Cantone il: 16 ottobre 2025
- Costo del progetto: CHF 396'000
- Importo del contributo: CHF 114'000
Aggiornamento del progetto maggio 2026
Il modello linguistico basato sull'IA sviluppato nell'ambito del progetto «IdiomVoice», promosso da GRdigital, per l'idioma romancio sursilvano costituisce la base del chatbot didattico «Chattaria Camenisch». Il chatbot interattivo comprende diversi personaggi della famiglia fittizia Camenisch di Ilanz (fig. 1). I personaggi hanno personalità e interessi diversi e possono essere scelti liberamente per le chat basate sull'IA.
L'obiettivo delle chat è l'esercizio di dialoghi quotidiani in sursilvano. Per rendere i dialoghi interessanti e motivanti, il chatbot interattivo trasmette, oltre alla lingua, anche contenuti culturali. Il chatbot si basa su un concetto didattico e può essere utilizzato come complemento al materiale didattico dell'Alta scuola pedagogica. Il chatbot viene testato costantemente con il gruppo target (principianti).
Per rendere possibile questo dialogo libero nel linguaggio quotidiano, il team di progetto della FHGR ha addestrato una prima versione di un modello linguistico open access per il sursilvano con testi continui, dialoghi e frasi quotidiane fornite da madrelingua («azione di donazione linguistica»). I testi continui e le frasi quotidiane sono per la maggior parte Open Data. Finora non erano disponibili set di dati di addestramento con dialoghi in sursilvano, motivo per cui nell'ambito del progetto abbiamo creato un set di dati di dialoghi quotidiani. Questo verrà pubblicato a breve come Open Data.
Per l'addestramento del modello linguistico utilizziamo modelli linguistici liberamente disponibili come Apertus, LLama e Mistral. Una valutazione dei diversi modelli linguistici in relazione alla qualità linguistica sarà pubblicata come pubblicazione specialistica. La versione finale del modello linguistico sarà pubblicata come modello open access al termine del progetto.
Alla mostra del progetto sarà possibile testare il prototipo con due personaggi: Lina (livello base A1) e sua nonna Brida.
Documenti
Domande
Per domande puoi rivolgerti a info@grdigital.digital.