BEGIN:VCALENDAR
VERSION:2.0
PRODID:-//LORIA - ECPv6.17.5//NONSGML v1.0//EN
CALSCALE:GREGORIAN
METHOD:PUBLISH
X-WR-CALNAME:LORIA
X-ORIGINAL-URL:https://www.loria.fr
X-WR-CALDESC:Évènements pour LORIA
REFRESH-INTERVAL;VALUE=DURATION:PT1H
X-Robots-Tag:noindex
X-PUBLISHED-TTL:PT1H
BEGIN:VTIMEZONE
TZID:Europe/Paris
BEGIN:DAYLIGHT
TZOFFSETFROM:+0100
TZOFFSETTO:+0200
TZNAME:CEST
DTSTART:20210328T010000
END:DAYLIGHT
BEGIN:STANDARD
TZOFFSETFROM:+0200
TZOFFSETTO:+0100
TZNAME:CET
DTSTART:20211031T010000
END:STANDARD
BEGIN:DAYLIGHT
TZOFFSETFROM:+0100
TZOFFSETTO:+0200
TZNAME:CEST
DTSTART:20220327T010000
END:DAYLIGHT
BEGIN:STANDARD
TZOFFSETFROM:+0200
TZOFFSETTO:+0100
TZNAME:CET
DTSTART:20221030T010000
END:STANDARD
BEGIN:DAYLIGHT
TZOFFSETFROM:+0100
TZOFFSETTO:+0200
TZNAME:CEST
DTSTART:20230326T010000
END:DAYLIGHT
BEGIN:STANDARD
TZOFFSETFROM:+0200
TZOFFSETTO:+0100
TZNAME:CET
DTSTART:20231029T010000
END:STANDARD
END:VTIMEZONE
BEGIN:VEVENT
DTSTART;TZID=Europe/Paris:20220414T133000
DTEND;TZID=Europe/Paris:20220414T153000
DTSTAMP:20220407T085534Z
CREATED:20220407T080922Z
LAST-MODIFIED:20220407T085534Z
UID:15610-1649943000-1649950200@www.loria.fr
SUMMARY:Soutenance de thèse : Adrien Dufraux
DESCRIPTION:La soutenance de thèse d’Adrien Dufraux\, intitulée : « Exploitation de transcriptions bruitées pour la reconnaissance automatique de la parole »\,  aura lieu en salle C005 du Loria le 14 avril à 13h30. Elle se déroulera en français\, et sera également diffusée en direct sur la plateforme Webex. \n  \nMembres du Jury:\nRapporteurs : \n\nYannick Estève\, Professeur\, Avignon Université – LIA\nAnthony Larcher\, Professeur\, Le Mans Université – LIUM\n\nExaminateurs : \n\nLori Lamel\, Directrice de Recherche\, CNRS – LISN\nMatthijs Douze\, Chercheur\, Meta AI\n\nDirecteurs de thèse : \n\nEmmanuel Vincent\, Directeur de Recherche\, Inria Nancy – Grand Est\nArmelle Brun\, Maître de Conférences\, Université de Lorraine – LORIA\n\nRésumé :\nLes méthodes usuelles pour la conception d’un système de reconnaissance automatique de la parole nécessitent des jeux de données de parole transcrite de bonne qualité. Ceux-ci sont composés du signal acoustique produit par un locuteur ainsi que de la transcription mot à mot de ce qui a été dit. Pour construire un bon modèle de reconnaissance automatique il faut plusieurs milliers d’heures de parole transcrite. Le jeu de données doit être créé à partir d’un panel de locuteurs et de situations différentes pour couvrir la variabilité de la parole et de la langue. Pour créer un tel jeu de données\, on demande généralement à des annotateurs humains d’écouter les signaux acoustiques et d’écrire le texte correspondant. Ce procédé coûte cher et est source d’erreurs car ce qui est dit lors d’un enregistrement en conditions réelles n’est pas toujours facilement intelligible. Des signaux mal transcrits impliquent une baisse de performance du modèle acoustique. Pour améliorer la qualité des transcriptions\, plusieurs personnes peuvent annoter le même signal acoustique\, mais alors le procédé coûte encore plus cher. \nCette thèse prend le contre-pied de cette démarche et propose de concevoir des algorithmes permettant d’utiliser des jeux de données dont les transcriptions sont « bruitées »\, c’est-à-dire qu’elles contiennent des erreurs. Le but principal est donc de réduire les coûts pour construire un système de reconnaissance automatique de la parole en limitant la perte de qualité du système induite par ces erreurs. \nDans un premier temps\, nous présentons l’algorithme Lead2Gold. Lead2Gold est basé sur une fonction de coût qui permet d’utiliser des jeux de données dont les transcriptions contiennent des erreurs. Nous modélisons ces erreurs par un modèle de bruit simple basé au niveau des lettres. Pour une transcription présente dans le jeu de données\, l’algorithme cherche un ensemble de transcriptions probablement meilleures. Nous utilisons pour cela une recherche en faisceau dans le graphe. Une telle technique de recherche n’est habituellement pas utilisée pour la formulation d’une fonction de coût. Nous montrons qu’il est possible d’ajouter explicitement de nouveaux éléments\, ici un modèle de bruit\, pour créer des fonctions de coût complexes. \nEnsuite nous améliorons la formulation de Lead2Gold pour que la fonction de coût soit modulable. Pour cela\, nous utilisons des wFST. Les wFST sont des graphes dont les arcs sont pondérés et représentent des symboles. Nous pouvons composer différents graphes pour construire des fonctions de coût de façon flexible. Avec notre proposition\, il devient plus facile d’ajouter de nouveaux éléments\, comme un lexique\, pour mieux caractériser les bonnes transcriptions. Nous montrons que l’utilisation des wFST est une bonne alternative à l’utilisation explicite de la recherche en faisceau de Lead2Gold. La formulation modulaire nous permet de proposer une nouvelle gamme de fonctions de coût modélisant les erreurs de transcription. \nEnfin nous procédons à une expérience de collecte de données en conditions réelles. Nous observons les différents profils d’annotateurs. Les annotateurs n’ont pas la même perception des signaux acoustiques et les erreurs qu’ils commettent peuvent être de natures différentes. Le but explicite de cette expérience est d’obtenir des transcriptions erronées et de prouver l’utilité de modéliser ces erreurs.
URL:https://www.loria.fr/event/soutenance-de-these-adrien-dufraux/
LOCATION:C005
CATEGORIES:Soutenance
END:VEVENT
END:VCALENDAR