Votre recherche
Résultats 3 ressources
-
Loflòc (Lexic obert flechit occitan - Lexique ouvert fléchi occitan) est un lexique informatisé de formes fléchies en occitan. Il a été réalisé dans le cadre du projet ANR RESTAURE (Bernard et Vergez-Couret, 2016) en collaboration avec Lo Congrès Permanent de la Lenga Occitana . La création d'un lexique informatisé pour l'occitan s'intègre dans un projet plus global de création de ressources linguistiques informatisées (pour une langue qui dispose de peu de ressources à l'heure actuelle). Ces ressources, qu’elles soient lexicales comme LoFlòc, ou textuelles comme BaTelÒc (Bras et Thomas 2011, Bras et Vergez Couret 2016), sont conçues en suivant un double objectif : d'une part la préservation et la diffusion du patrimoine linguistique et d'autre part la création de ressources pour le développement d'outils de traitement automatique des langues (par exemple des outils pour la recherche et l’extraction d'information, la traduction automatique...). La création de ces ressources se fait en harmonie avec la Feuille de route pour le développement du numérique occitan (Lo Congrès, 2014 ; Dazéas, 2015, Séguier et Mercadier, 2016). Les objectifs qui ont présidé à la création de Loflòc sont les suivants : •Doter l'occitan d'un lexique structuré de formes fléchies adapté aux besoins du TAL (Traitement Automatique des Langues) pour être intégré à des applications comme un lemmatiseur ou un analyseur morphosyntaxique (Vergez-Couret et Urieli, 2015) ; •Intégrer le lexique dans une interface de consultation ; •Utiliser un jeu d'étiquettes morphosyntaxiques (tagset) standard ; •Accueillir par étapes toute la variation (dialectale, intra-dialectale, graphique). Les variations, qu'elles soient dialectales, intradialectales ou graphiques, sont présentes dans les productions en occitan, anciennes et actuelles. Les outils automatiques, tout comme les locuteurs (néo-locuteurs, apprenants…), sont confrontés à toutes ces variations. Afin de bâtir des outils les plus robustes possibles, il faut savoir décrire et représenter cette variation dans les lexiques. En outre, dans les outils de consultation et d'interrogation du lexique, l'utilisateur pourra découvrir et mieux appréhender toute la variation possible. Pour constituer ce lexique, nous commençons par intégrer des ressources existantes au format numérique, à les enrichir avec des informations grammaticales lorsque ces dernières sont incomplètes ou inadaptées et à compléter les paradigmes flexionnels (genre et nombre…). Les premières ressources intégrées à Loflòc pour le languedocien sont le Dictionnaire Occitan-Français Languedocien de Laux (2001), Dictionnaire Français-Occitan Languedocien de Laux (2005) ainsi que les données de l'application vèrb'Òc, conjugueur édité par Lo Congrès (Sauzet et Ubaud, 1995 ; Sauzet, 2016). En effet, ceux-ci ayant été normalisés au format XML (norme TEI P5) par le Congrès, il a été possible d’en extraire automatiquement les lemmes, leurs flexions et les informations grammaticales nécessaires. En ce qui concerne la structure et le choix des standards pour Loflòc, nous nous inspirons des lexiques français tels que Morphalou (Romary, et al, 2004) et GlaFF (Sajous, et al., 2013). Nous avons adopté les étiquettes du standard Eagles/Multext/Grace (Rajman et al., 1997) que nous avons gardées en anglais tout en les adaptant aux spécificités de l'occitan. Cela facilitera la comparaison de notre lexique aux lexiques des langues proches qui ont également adopté des jeux d'étiquettes semblables et comparables (français, catalan). Nous présenterons dans la communication le lexique, sa structure, son contenu, ainsi que les différents types d’application qui ne peuvent être développées sans un lexique de ce type (analyseurs morpho-syntaxiques, analyseurs syntaxiques, traducteurs automatiques, outils de recherche d’information, outils d’aide à la rédaction de textes ou sms, correcteurs orthographiques, etc.). Bibliographie : Bernhard, D., et Vergez-Couret, M. (2016). Le projet RESTAURE. In Les technologies pour les langues régionales de France, 82 90. Condé-sur-Noireau: DGLFLF. Bras, M., Thomas, J. (2011). « Batelòc : cap a una basa informatisada de tèxtes occitans », in A. Rieger & D. Sumien (eds). Occitània convidada d’Euregio. Lièja 1981 - Aquisgran 2008 : Bilanç e amiras. Actes du Neuvième Congrès International de l’Association Internationale d’Études Occitanes, Aix-la-Chapelle, 24-31 août 2008, Aachen, Shaker. Bras, M. & Vergez-Couret, M. (2016). « BaTelÒc: A text base for the Occitan language. », in Vera Ferreira and Peter Bouda (eds.) Language Documentation and Conservation in Europe, Honolulu: University of Hawai'i Press, pp. 133-149. Dazéas, B. (2015). Feuille de route pour le développement numérique occitan. In Actes de la Traitement Automatique des Langues Régionales de France et d’Europe, Caen. Laux C. (2001). Dictionnaire occitan-français : languedocien, avec la collab. de Serge Granier, Puylaurens, IEO, Section du Tarn. Laux C. (2005). Dictionnaire Français-Occitan. Castres : IEO del Tarn. Lo Congrès (2014). Diagnostic e huelha de rota tau desvolopament numeric de la lenga occitana 2015-2019, rapòrt finau deu projècte. Media.kom, elhuyar. http://locongres.org/images/docs/huelha_rota_numeric_occitan_oc.pdf. Rajman M. (1997). Format de description lexicale pour le français – Partie 2 : description morphosyntaxique, technical report GRACE, http://www.limsi.fr/grace/. Romary L., Salmon-Alt S., Francopoulo G. (2004). Standards going concrete : from LMF to Morphalou. Workshop on Electronic Dictionaries, Coling 2004, Geneva, Switzerland. Sajous, F., Hathout, N., Calderone, B. (2013). 'GLÀFF, un Gros Lexique À tout Faire du Français'. Actes de la conférence Traitement Automatique des Langues Naturelles (TALN 2013). Sauzet, P., Ubaud, J. (1995). Le verbe occitan. Lo vèrb occitan. Aix-en-Provence : Édisud. Sauzet, P. (2016). Conjugaison occitane. IEO edicions. Séguier, A., et Mercadier, G. (2016). Le numérique au service de la transmission de la langue occitane : situation et perspectives de développement ». In Les technologies pour les langues régionales de France, 82 90. Condé-sur-Noireau: DGLFLF. Vergez-Couret, M., et Urieli, A. (2015). Analyse morphosyntaxique de l’occitan languedocien : l’amitié entre un petit languedocien et un gros catalan. In Actes du Workshop Traitement Automatique des Langues Régionales de France et d’Europe, Caen.
-
Occitan is a minority language spoken in Southern France, some Alpine Valleys of Italy, and the Val d'Aran in Spain, which only very recently started developing language and speech technologies. This paper describes the first project for designing a Text-to-Speech synthesis system for one of its main regional varieties, namely Gascon. We used a state-of-the-art deep neural network approach, the Tacotron2-WaveGlow system. However, we faced two additional difficulties or challenges: on the one hand, we wanted to test if it was possible to obtain good quality results with fewer recording hours than is usually reported for such systems; on the other hand, we needed to achieve a standard, non-Occitan pronunciation of French proper names, therefore we needed to record French words and test phoneme-based approaches. The evaluation carried out over the various developed systems and approaches shows promising results with near production-ready quality. It has also allowed us to detect the phenomena for which some flaws or fall of quality occur, pointing at the direction of future work to improve the quality of the actual system and for new systems for other language varieties and voices.
-
This paper describes different approaches for developing, for the first time, an automatic speech recognition system for two of the main dialects of Occitan, namely Gascon and Languedocian, and the results obtained in them. The difficulty of the task lies in the fact that Occitan is a less-resourced language. Although a great effort has been made to collect or create corpora of each variant (transcribed speech recordings for the acoustic models and two text corpora for the language models), the sizes of the corpora obtained are far from those of successful systems reported in the literature, and thus we have tested different techniques to compensate for the lack of resources. We have developed classical systems using Kaldi, creating an acoustic model for each variant and also creating language models from the collected corpora and from machine translated texts. We have also tried fine-tuning a Whisper model with our speech corpora. We report word error rates of 20.86 for Gascon and 13.52 for Languedocian with the Kaldi systems and 16.37 for Gascon and 11.74 for Languedocian with Whisper.