ASMSP-L4.5
SylVAD: Improving In-Vehicle Voice Activity Detection via Syllable-Level Alignment
Eunmi Seo, Hyundai Motor Company, Korea (South)
Session:
ASMSP-L4: Learning-Based Audio Modeling Lecture
Track:
ASMSP - Acoustic, Speech and Music Signal Processing
Location:
Concert Hall
Presentation Time:
Thu, 3 Sep, 15:20 - 15:40 Belgium Time (UTC +2)
Presentation
Discussion
Resources
No resources available.
Session ASMSP-L4
ASMSP-L4.1: MUKA: MULTI KERNEL AUDIO ADAPTATION OF AUDIO-LANGUAGE MODELS
Reda Bensaid, IMT Atlantique / Polytechnique Montréal, France; Amine Ouasfi, INRIA, university rennes, France; Yassir Bendou, IMT Atlantique, France; Ilyass Moummad, INRIA, Université de Montpellier, France; Vincent Gripon, IMT Atlantique, France; François Leduc-Primeau, Polytechnique Montréal, Canada; Adnane Boukhayma, INRIA, university rennes, France
ASMSP-L4.2: What Do Neurons Listen To? A Neuron-level Dissection of a General-purpose Audio Model
Takao Kawamura, Daisuke Niizumi, Nobutaka Ono, Tokyo Metropolitan University, Japan
ASMSP-L4.3: DISSE: LEARNING DISENTANGLED SOURCE AND SPATIAL REPRESENTATIONS FROM SPATIAL AUDIO–TEXT CONTRASTIVE LEARNING
Shotaro Ueji, Keio University, Japan; Shinnosuke Takamichi, Keio University / The University of Tokyo, Japan; Kouei Yamaoka, The University of Tokyo, Japan
ASMSP-L4.4: PHYSICS-INFORMED NEURAL ENGINE SOUND MODELING WITH DIFFERENTIABLE PULSE-TRAIN SYNTHESIS
Robin Doerfler, Impulse Audio Lab GmbH, Germany; Lonce Wyse, Universitat Pompeu Fabra, Spain
ASMSP-L4.5: SylVAD: Improving In-Vehicle Voice Activity Detection via Syllable-Level Alignment
Eunmi Seo, Hyundai Motor Company, Korea (South)