BEGIN:VCALENDAR
VERSION:2.0
PRODID:-//LORIA - ECPv6.17.4.1//NONSGML v1.0//EN
CALSCALE:GREGORIAN
METHOD:PUBLISH
X-ORIGINAL-URL:https://www.loria.fr
X-WR-CALDESC:Évènements pour LORIA
REFRESH-INTERVAL;VALUE=DURATION:PT1H
X-Robots-Tag:noindex
X-PUBLISHED-TTL:PT1H
BEGIN:VTIMEZONE
TZID:Europe/Paris
BEGIN:DAYLIGHT
TZOFFSETFROM:+0100
TZOFFSETTO:+0200
TZNAME:CEST
DTSTART:20230326T010000
END:DAYLIGHT
BEGIN:STANDARD
TZOFFSETFROM:+0200
TZOFFSETTO:+0100
TZNAME:CET
DTSTART:20231029T010000
END:STANDARD
BEGIN:DAYLIGHT
TZOFFSETFROM:+0100
TZOFFSETTO:+0200
TZNAME:CEST
DTSTART:20240331T010000
END:DAYLIGHT
BEGIN:STANDARD
TZOFFSETFROM:+0200
TZOFFSETTO:+0100
TZNAME:CET
DTSTART:20241027T010000
END:STANDARD
BEGIN:DAYLIGHT
TZOFFSETFROM:+0100
TZOFFSETTO:+0200
TZNAME:CEST
DTSTART:20250330T010000
END:DAYLIGHT
BEGIN:STANDARD
TZOFFSETFROM:+0200
TZOFFSETTO:+0100
TZNAME:CET
DTSTART:20251026T010000
END:STANDARD
END:VTIMEZONE
BEGIN:VEVENT
DTSTART;TZID=Europe/Paris:20241001T150000
DTEND;TZID=Europe/Paris:20241001T170000
DTSTAMP:20240923T123417Z
CREATED:20240923T123417Z
LAST-MODIFIED:20240923T123417Z
UID:26698-1727794800-1727802000@www.loria.fr
SUMMARY:PhD Defense: Can Cui (Multispeech)
DESCRIPTION:Can Cui (Multispeech) will defend his thesis\, entitled « Joint speech separation\, diarization and recognition for automatic meeting transcription »\, on Tuesday\, October 1 at 3 p.m.\, in room A008. \nAbstract:\nFar-field microphone-array meeting transcription is particularly challenging due to overlapping speech\, ambient noise\, and reverberation. To address these issues\, we explored three approaches. First\, we employ a multichannel speaker separation model to isolate individual speakers\, followed by a single-channel\, single-speaker automatic speech recognition (ASR) model to transcribe the separated and enhanced audio. This method effectively enhances speech quality for ASR.\nSecond\, we propose an end-to-end multichannel speaker-attributed ASR (MC-SA-ASR) model\, which builds on an existing single-channel SA-ASR model and incorporates a multichannel Conformer-based encoder with multi-frame cross-channel attention (MFCCA). Unlike traditional approaches that require a multichannel front-end speech enhancement model\, the MC-SA-ASR model handles far-field microphones in an end-to-end manner. We also experimented with different input features\, including Mel filterbank and phase features\, for that model.\nLastly\, we incorporate a multichannel beamforming and enhancement model as a front-end processing step\, followed by a single-channel SA-ASR model to process the enhanced multi-speaker speech signals. We tested different fixed\, hybrid\, and fully neural network-based beamformers and proposed to jointly optimize the neural beamformer and SA-ASR models using the training objective for the latter.\nIn addition to these methods\, we developed a meeting transcription pipeline that integrates voice activity detection\, speaker diarization\, and SA-ASR to process real meeting recordings effectively.\n\nExperimental results indicate that\, while using a speaker separation model can enhance speech quality\, separation errors can propagate to ASR\, resulting in suboptimal performance. A guided speaker separation approach proves to be more effective. Our proposed MC-SA-ASR model demonstrates efficiency in integrating multichannel information and the shared information between the ASR and speaker blocks.\nExperiments with different input features reveal that models trained with Mel filterbank features perform better in terms of word error rate (WER) and speaker error rate (SER) when the number of channels and speakers is low (2 channels with 1 or 2 speakers). However\, for settings with 3 or 4 channels and 3 speakers\, models trained with additional phase information outperform those using only Mel filterbank features. This suggests that phase information can enhance ASR by leveraging localization information from multiple channels.\n\nAlthough MFCCA-based MC-SA-ASR outperforms the single-channel SA-ASR and MC-ASR models without a speaker block\, the joint beamforming and SA-ASR model further improves the performance. Specifically\, joint training of the neural beamformer and SA-ASR yields the best performance\, indicating that improving speech quality might be a more direct and efficient approach than using an end-to-end MC-SA-ASR model for multichannel meeting transcription.\nFurthermore\, the study of the real meeting transcription pipeline underscores the potential for better end-to-end models. In our investigation on improving speaker assignment in SA-ASR\, we found that the speaker block does not effectively help improve the ASR performance. This highlights the need for improved architectures that more effectively integrate ASR and speaker information.\n\nKey words: Multichannel separation\, end-to-end speaker-attributed ASR\, meeting transcription\, speaker diarization \nThesis Committee:\n\nReviewers: \n\nReinhold Häb-Umbach\, Professor\, University of Paderborn\, Germany\nYannick Estève\, Professor\, Avignon Université\, France\n\nExaminers: \n\nMarie Tahon\, Professor\, Université du Mans\, France\n\nSupervisors: \n\n\nEmmanuel Vincent\, Senior Research Scientist\, Centre Inria de l’U. de Lorraine\, France\nMostafa Sadeghi\, Inria Starting Faculty Position\, Centre Inria de l’U. de Lorraine\, France\nImran Sheikh\, Research engineer\, Vivoka\, France\n\n\n\n 
URL:https://www.loria.fr/event/phd-defense-can-cui-multispeech/
LOCATION:A008
CATEGORIES:Soutenance
END:VEVENT
BEGIN:VEVENT
DTSTART;TZID=Europe/Paris:20241010T133000
DTEND;TZID=Europe/Paris:20241010T153000
DTSTAMP:20240828T084609Z
CREATED:20240828T084609Z
LAST-MODIFIED:20240828T084609Z
UID:26596-1728567000-1728574200@www.loria.fr
SUMMARY:Soutenance de thèse de Sewade Ogun
DESCRIPTION:Sewade Ogun (Multispeech) soutiendra sa thèse intitulée « Synthèse de la parole diversifiée pour l’augmentation des données d’apprentissage de la RAP » le 10 octobre à 13h30\, en salle A008. \nRésumé\nAu cours des deux dernières décennies\, le taux d’erreur des systèmes de reconnaissance automatique de la parole (RAP) a chuté drastiquement\, les rendant ainsi plus utiles dans les applications réelles. Cette amélioration peut être attribuée à plusieurs facteurs\, dont les nouvelles architectures utilisant des techniques d’apprentissage profond\, les nouveaux algorithmes d’entraînement\, les ensembles de données d’entraînement grands et diversifiés\, et l’augmentation des données. En particulier\, les jeux de données d’entraînement de grande taille ont été essentiels pour apprendre des représentations robustes de la parole pour les systèmes de RAP. Leur taille permet de couvrir efficacement la diversité inhérente à la parole\, en terme de voix des locuteurs\, de vitesse de parole\, de hauteur\, de réverbération et de bruit. \nCependant\, la taille et la diversité des jeux de données disponibles dans les langues bien dotées ne sont pas accessibles pour les langues moyennement ou peu dotées\, ainsi que pour des domaines à vocabulaire spécialisé comme le domaine médical. Par conséquent\, la méthode populaire pour augmenter la diversité des ensembles de données est l’augmentation des données. Avec l’augmentation récente de la naturalité et de la qualité des données synthétiques pouvant être générées par des systèmes de synthèse de la parole (TTS) et de conversion de voix (VC)\, ces derniers sont également devenus des options viables pour l’augmentation des données de RAP. Cependant\, plusieurs problèmes limitent leur application. \nPremièrement\, les systèmes de TTS/VC nécessitent des données de parole de haute qualité pour l’entraînement. Par conséquent\, nous développons une méthode de curation d’un jeux de données à partir d’un corpus conçu pour la RAP pour l’entraînement d’un système de TTS. Cette méthode exploite la précision croissante des estimateurs de qualité non intrusifs basés sur l’apprentissage profond pour filtrer les échantillons de haute qualité. Nous explorons le filtrage du jeux de données de RAP à différents seuils pour équilibrer sa taille\, le nombre de locuteurs et la qualité. Avec cette méthode\, nous créons un ensemble de données interlocuteurs de haute qualité\, comparable en qualité à LibriTTS. \nDeuxièmement\, le processus de génération de données doit être contrôlable pour générer des données TTS/VC diversifiées avec des attributs spécifiques. Les systèmes TTS/VC précédents conditionnent soit le système sur l’empreinte du locuteur seule\, soit utilisent des modèles discriminatifs pour apprendre les variabilités de la parole. Dans notre approche\, nous concevons une architecture améliorée basée sur le flux qui apprend la distribution de différentes variables de la parole. Nous constatons que nos modifications augmentent significativement la diversité et la naturalité des énoncés générés par rapport à une référence GlowTTS\, tout en étant contrôlables. \nEnfin\, nous avons évalué l’importance de générer des données des TTS et VC diversifiées pour augmenter les données d’entraînement de RAP. Contrairement à la génération naïve des données TTS/VC\, nous avons examiné indépendamment différentes approches telles que les méthodes de sélection des phrases et l’augmentation de la diversité des locuteurs\, la durée des phonèmes et les contours de hauteur\, en plus d’augmenter systématiquement les conditions environnementales des données générées. Nos résultats montrent que l’augmentation TTS/VC est prometteuse pour augmenter les performances de RAP dans les régimes de données faibles et moyen. En conclusion\, nos expériences fournissent un aperçu des variabilités particulièrement importantes pour la RAP et révèlent une approche systématique de l’augmentation des données de RAP utilisant des données synthétiques. \nJury\n\nSerena Ivaldi\, Directrice de recherche\, Centre Inria de l’Université de Lorraine\nRalf Schlüter\, Privatdozent\, RWTH Aachen University\nNicolas Obin\, Maître de conférences\, Sorbonne Université\nEmmanuel Dupoux\, Directeur d’études\, EHESS\n\nEncadrants \n\nEmmanuel Vincent\, Directeur de recherche\, Centre Inria de l’Université de Lorraine\nVincent Colotte Maitre de conferences\, Université de Lorraine
URL:https://www.loria.fr/event/soutenance-de-these-de-sewade-ogun/
LOCATION:A008
CATEGORIES:Soutenance
END:VEVENT
BEGIN:VEVENT
DTSTART;TZID=Europe/Paris:20241018T100000
DTEND;TZID=Europe/Paris:20241018T120000
DTSTAMP:20240820T115326Z
CREATED:20240813T144842Z
LAST-MODIFIED:20240820T115326Z
UID:26569-1729245600-1729252800@www.loria.fr
SUMMARY:Soutenance de thèse de Célina Treuillier
DESCRIPTION:Célina Treuillier (Bird) soutiendra sa thèse intitulée « Modélisation individuelle et multi-factorielle du phénomène de polarisation pour une personnalisation de l’apport en diversité dans les recommandations de news » le 18 octobre à 10h en salle A008. \nRésumé\nLa polarisation est un phénomène complexe exacerbé par les médias sociaux\, auquel les systèmes de recommandation contribuent en limitant l’exposition à des opinions diverses. Pour contrer cet enjeu sociétal et favoriser un débat démocratique sain\, il est crucial de développer des stratégies de recommandation favorisant une dépolarisation personnalisée. Une compréhension du phénomène de polarisation est néanmoins indispensable au développement de telles stratégies. Dans une première partie\, cette thèse propose une modélisation individuelle et multi-factorielle du phénomène de polarisation. Un modèle générique et paramétrable\, reposant sur la métrique GRAIL (GeneRalized AddItive poLarization)\, permet de distinguer des classes de comportement et contribue à une meilleure compréhension de la polarisation. Une modélisation temporelle abordant la polarisation comme un processus dynamique permet ensuite d’identifier des périodes de polarisation\, influencées par la maturité des débats et des événements contextuels. Dans une seconde partie\, l’approche de diversification personnalisée ADF (Accuracy-Diversity-Fairness) est proposée. Les approches de la littérature peinent à maîtriser la nature de la diversité apportée\, et peuvent artificiellement orienter les opinions des utilisateurs. L’approche ADF propose une optimisation tri-objectif permettant de fournir des recommandations répondant aux attentes des utilisateurs\, tout en les exposant à un contenu plus diversifié sans influencer leurs opinions. Ces travaux participent à une modélisation plus fine du phénomène de polarisation\, permettant d’envisager développement de stratégies dépolarisantes efficaces et éthiques. Ce travail met en lumière le rôle central que joue l’IA pour répondre aux enjeux sociétaux contemporains. \nJury\nEncadrants \n\nArmelle Brun – Professeure des Universités\, Université de Lorraine\nSylvain Castagnos – Maître de conférences\, Université de Lorraine\n\nRapporteurs \n\nCamille Salinesi – Professeur des Universités\, Université Paris 1 Panthéon – Sorbonne\nElsa Negre – Maîtresse de conférences HDR\, Université Paris – Dauphine\n\nExaminateurs : \n\nKarën Fort – Professeure des Universités\, Université de Lorraine\nRaphaël Fournier S’niehotta – Maître de conférences\, CNAM Paris
URL:https://www.loria.fr/event/soutenance-de-celina-treuillier/
LOCATION:A008
CATEGORIES:Soutenance
END:VEVENT
END:VCALENDAR