Sign in

arXiv cs.SD Sound

@cssd-bot.bsky.social
77 followers 1 following 6.9K posts

Unofficial bot by @vele.bsky.social w/ github.com/so-okada/bXiv arxiv.org/list/cs.SD/new List bsky.app/profile/vele.bsky.social/l… ModList bsky.app/profile/vele.bsky.social/l…

PostsRepliesMedia
arXiv cs.SD Sound @cssd-bot.bsky.social · 19h
Haider Al-Tahan, Sean O'Brien, Anastasia Razdaibiedina, N. Apurva Ratan Murty: LAST: Looped Audio Spectrogram Transformer arxiv.org/abs/2610.01926 arxiv.org/pdf/2610.01926 arxiv.org/html/2610.01926
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 19h
Liwei Lin, Gus Xia: From Isolated Feature to Orbits: Discovering Music Concepts via Multi-SAE Alignment arxiv.org/abs/2610.01864 arxiv.org/pdf/2610.01864 arxiv.org/html/2610.01864
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 19h
Serli Kopar, Alkis Koudounas, Roshan P. Rane, Sam Gijsen, Paula A. Perez-Toro, Kerstin Ritter: Beyond Decodability: Do Acoustic Factors Drive Predictions in Speech-Based Alzheimer's Assessment? arxiv.org/abs/2610.01846 arxiv.org/pdf/2610.01846 arxiv.org/html/2610.01846
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 19h
Jeeyoung Yun, Seohwan Yun, Sungwoong Kim: Q-SPT: Learnable Query-Based Compression for Low-Frame-Rate Speech Tokenization arxiv.org/abs/2610.01492 arxiv.org/pdf/2610.01492 arxiv.org/html/2610.01492
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 19h
Mohammed Hafsati, Ahmed Loughzali: Multi-Party Backchannel Prediction: a Diagnosis, a Benchmark, and a Ceiling arxiv.org/abs/2610.01488 arxiv.org/pdf/2610.01488 arxiv.org/html/2610.01488
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 19h
Sihan Lv, Zhen Li, Zhiqi Cao, Jinshan Zhang, Ying Li, Meng Xi, Jianwei Yin: AudioJev: Direct Audio Decisions with Order-Calibrated Probabilities arxiv.org/abs/2610.01293 arxiv.org/pdf/2610.01293 arxiv.org/html/2610.01293
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 19h
Hwayeon Kim, Youngwon Choi, Hyeonyu Kim: Toward Elastic Speech Inference: Training-Free Wake-Word Detection from Pretrained ASR arxiv.org/abs/2610.01182 arxiv.org/pdf/2610.01182 arxiv.org/html/2610.01182
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 19h
Chen, Wang, Fan, Hao, Kong, Zhu, Hong, Chen, Su, Jian, Yang, Hu, Du, Luan, Li: RMS-AQA: A Two-Stage Spatial Audio Question Answering Benchmark for Real-World Domestic Environments arxiv.org/abs/2610.00935 arxiv.org/pdf/2610.00935 arxiv.org/html/2610.00935
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 19h
Changchang Sun, Lu Cheng, Yan Yan: Where the Body Keeps the Beat: Structured Motion Conditioning and Music Dynamics Supervision for Dance-to-Music Generation arxiv.org/abs/2610.00726 arxiv.org/pdf/2610.00726 arxiv.org/html/2610.00726
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 19h
Pooneh Mousavi, Amir Ivry, Mirco Ravanelli, Cem Subakan: AnchorPrompt: Self-Distilled Soft Prompts for Robust Audio-Language Models arxiv.org/abs/2610.00706 arxiv.org/pdf/2610.00706 arxiv.org/html/2610.00706
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 19h
Nikita Vasiliev, Kirill Borodin, Vasilii Kudryavtsev, Maxim Maslov, Grach Mkrtchian: Balalaika-Longform: A Russian Speech Corpus for Continuous Long-Form Text-to-Speech arxiv.org/abs/2610.00658 arxiv.org/pdf/2610.00658 arxiv.org/html/2610.00658
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 19h
Lisan Al Amin, Lei Zhang, Vandana P. Janeja: On Evaluating Quantum Kernel Robustness for Low-Resource Cross-Corpus Audio Deepfake Detection arxiv.org/abs/2610.00649 arxiv.org/pdf/2610.00649 arxiv.org/html/2610.00649
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 19h
Tiernon Riesenmy, You Zhang, Gautam Bhattacharya, Andrea Fanelli: PLACE: Positional Latent Adaptation via Conditioned Embeddings for Binaural Audio Generation arxiv.org/abs/2610.00630 arxiv.org/pdf/2610.00630 arxiv.org/html/2610.00630
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 19h
Ksenia Lysikova, Kirill Borodin, Maxim Maslov, Grach Mkrtchian: Collapse, Not Invariance: Diagnosing Auxiliary Objectives in Speech Anti-Spoofing arxiv.org/abs/2610.00539 arxiv.org/pdf/2610.00539 arxiv.org/html/2610.00539
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 19h
Maxim Trokunov, Kirill Borodin, Nikita Vasiliev, Grach Mkrtchian: ProxyMOS: Label-Free Speech Quality Assessment by Multi-Teacher Distillation with Adaptive Routing arxiv.org/abs/2610.00419 arxiv.org/pdf/2610.00419 arxiv.org/html/2610.00419
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 19h
Chibuzor Okocha, Christan Earl Grant: How Robust Are Neural Audio Codecs for African Speech? A Multi-Task Benchmark and the Limits of Perceptual Quality arxiv.org/abs/2610.00154 arxiv.org/pdf/2610.00154 arxiv.org/html/2610.00154
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 19h
Sidi Chang, Peiying Zhu: High-Value Synthetic Supervision for Parameter-Efficient Adaptation of a Compact Japanese Speech Model arxiv.org/abs/2610.00026 arxiv.org/pdf/2610.00026 arxiv.org/html/2610.00026
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 19h
[2026-10-02 Fri (UTC), 17 new articles found for csSD Sound]
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 01/10/2026
Takuhiro Kaneko, Hirokazu Kameoka, Kou Tanaka, Yuto Kondo: MeanVoiceFlow2: Joint Optimization of Mean Flow and Content Encoder for Fast One-Step Zero-Shot Voice Conversion arxiv.org/abs/2609.40087 arxiv.org/pdf/2609.40087 arxiv.org/html/2609.40087
010
arXiv cs.SD Sound @cssd-bot.bsky.social · 01/10/2026
Rong Wan, Suliu Qin, Jiaxi Li, Wei Xie, Wenwu Wang, Xiaolong Han, Lu Yin, Xilu Wang: SEAR: Spoofing Evidence-Grounded Audio Reasoning Benchmark for Audio Language Models arxiv.org/abs/2609.39847 arxiv.org/pdf/2609.39847 arxiv.org/html/2609.39847
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 01/10/2026
Viola Negroni, Paolo Bestagini, Stefano Tubaro: Synthetic Speech Attribution via Prototypical Networks arxiv.org/abs/2609.39722 arxiv.org/pdf/2609.39722 arxiv.org/html/2609.39722
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 01/10/2026
Rong Wan, Wei Xie, Jiaxi Li, Wenwu Wang, Lu Yin, Yiliao Song, Xilu Wang: SE-ADD: Self-Evolving Audio Deepfake Detection with Mistake-Driven Supervision arxiv.org/abs/2609.39679 arxiv.org/pdf/2609.39679 arxiv.org/html/2609.39679
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 01/10/2026
Jungwoo Kim, Joonyong Park, Junyoung Koh, Jong-Seok Lee: Neural Audio Codec for Robust Audio Deepfake Detection arxiv.org/abs/2609.39651 arxiv.org/pdf/2609.39651 arxiv.org/html/2609.39651
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 01/10/2026
Arhan Vohra, Choenden Kyirong, Laura Ib\'a\~nez-Mart\'inez, Mart\'in Rocamora: Ghost in the Encoder: Decodable Artist Identity Representations in Lyrics-to-Song Generation arxiv.org/abs/2609.39552 arxiv.org/pdf/2609.39552 arxiv.org/html/2609.39552
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 01/10/2026
Hezhao Zhang, Thomas Hain: From Speech to Editable Concepts: Probing Emotion Recognition with Concept Bottleneck Models arxiv.org/abs/2609.39453 arxiv.org/pdf/2609.39453 arxiv.org/html/2609.39453
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 01/10/2026
Shantanu Vispute, Aditya Mishra, Siddhartha Saxena: Who Said What, and Will It Be Remembered? Evaluating Persistent Speaker Attribution Across Meetings arxiv.org/abs/2609.39344 arxiv.org/pdf/2609.39344 arxiv.org/html/2609.39344
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 01/10/2026
Shengbo Cai, Zhisheng Zhang, Zichao Nie, Jing Peng, Jingran Xie, Zhiyong Wu: UniAE-MoE: A Unified Audio Encoder via Mixture of Experts arxiv.org/abs/2609.39199 arxiv.org/pdf/2609.39199 arxiv.org/html/2609.39199
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 01/10/2026
Yehoshua Dissen, Joseph Keshet, Eduard Golshtein: Training-Free Affinity Fusion of Neural and Embedding-Based Speaker Diarization arxiv.org/abs/2609.39162 arxiv.org/pdf/2609.39162 arxiv.org/html/2609.39162
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 01/10/2026
Longyu Lu, Zongwei Du, Mengtao Xing, Zhuoqun Liu, Zifan Guan, Meiguang Jin, Junfeng Ma: SCIC: Scope- and Codebook-Aware Instruction Conditioning for Speaker-Adapted Expressive TTS arxiv.org/abs/2609.39088 arxiv.org/pdf/2609.39088 arxiv.org/html/2609.39088
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 01/10/2026
Xinrui Jiang, Heng Yu: Game Sound-Effect Completion with Event-Level Transformation Hints arxiv.org/abs/2609.39044 arxiv.org/pdf/2609.39044 arxiv.org/html/2609.39044
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 01/10/2026
Kusunoki, Ochiai, Tawara, Delcroix, Kamo, Ogawa, Araki: How Reliable Are Predicted MOS for Reproducing Human System-Level Preferences in Speech Enhancement? arxiv.org/abs/2609.39032 arxiv.org/pdf/2609.39032 arxiv.org/html/2609.39032
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 01/10/2026
Saini, Bezzam, G\"otz, Milo, Gu{\dh}j\'onsson, Gkanos, Pind, Nielsen: FFASR: Benchmarking Far-Field Automatic Speech Recognition using High-Fidelity Simulated RIRs arxiv.org/abs/2609.38897 arxiv.org/pdf/2609.38897 arxiv.org/html/2609.38897
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 01/10/2026
Kyoungjun Park, Yunzhe Li, Lili Qiu: Audio Token Attention Is Predictable Before the Language Model Runs arxiv.org/abs/2609.38878 arxiv.org/pdf/2609.38878 arxiv.org/html/2609.38878
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 01/10/2026
Ji Hwan Park, Gautham Krishna Gudur, Yufei Shen, Dawei Liang, Edison Thomaz: RAST: Resolution-Aware Privileged Structure Transfer for Low-Resolution Audio Activity Recognition arxiv.org/abs/2609.38780 arxiv.org/pdf/2609.38780 arxiv.org/html/2609.38780
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 01/10/2026
Beno\^it Ginies, Olivier Fercoq, Ga\"el Richard: Multi-Rate Bandwidth Extension by Token Completion in Neural Audio Codecs arxiv.org/abs/2609.38502 arxiv.org/pdf/2609.38502 arxiv.org/html/2609.38502
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 01/10/2026
Mengzhe Geng: When Does a Spoken Agent Have Enough Evidence to Act? The PACT-SLM Contract Test arxiv.org/abs/2609.38232 arxiv.org/pdf/2609.38232 arxiv.org/html/2609.38232
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 01/10/2026
[2026-10-01 Thu (UTC), 18 new articles found for csSD Sound]
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 30/09/2026
Kuan-Po Huang, Haohe Liu, Puyuan Peng, Haibin Wu, Zhaoheng Ni, Hung-yi Lee, Jinwon Lee, Neha Chachra: EmoRES-TTS: Residual-Enhanced Vector Steering for Emotional Speech Generation arxiv.org/abs/2609.38157 arxiv.org/pdf/2609.38157 arxiv.org/html/2609.38157
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 30/09/2026
Ganesh Pavan Kartikeya Bharadwaj Kolluri, Michael Kampouridis, Ravi Shekhar: Pruning for Efficiency, Paying in Fairness: Demographic Disparities in Pruned Speech-LLMs arxiv.org/abs/2609.38106 arxiv.org/pdf/2609.38106 arxiv.org/html/2609.38106
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 30/09/2026
Julien Boussard, M\'elisande Teng, Sulagna Saha, Mario Gallego-Abenza: 2-Dimensional spectral gating for denoising bioacoustics recordings arxiv.org/abs/2609.37910 arxiv.org/pdf/2609.37910 arxiv.org/html/2609.37910
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 30/09/2026
Xiaosha Li, Chun Liu, Ziyu Wang: Do Music Generative Models Understand Musical Qualities? Automatic Music Evaluation with Model-Intrinsic Signals arxiv.org/abs/2609.37710 arxiv.org/pdf/2609.37710 arxiv.org/html/2609.37710
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 30/09/2026
Yunzhe Li, Kyoungjun Park, Hongzi Zhu, Lili Qiu: AS$^2$D: Accelerating On-Demand Audio Understanding on Mobile Devices arxiv.org/abs/2609.37617 arxiv.org/pdf/2609.37617 arxiv.org/html/2609.37617
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 30/09/2026
Yuankun Xie, Xiaoxuan Guo, Xiaopeng Wang, Siqing Qin, Shaole Li, Kong Aik Lee: Learning as Deepfakes Evolve: RF-Prompt for Continual Audio Deepfake Detection arxiv.org/abs/2609.37586 arxiv.org/pdf/2609.37586 arxiv.org/html/2609.37586
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 30/09/2026
Ciapponi, Dal R{\i}, Conci, Farella: Rate-Agnostic Bioacoustics: Heterogeneous Multi-Taxa Classification with Continuous Filterbanks and Fourier Neural Operators arxiv.org/abs/2609.37540 arxiv.org/pdf/2609.37540 arxiv.org/html/2609.37540
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 30/09/2026
Stefano Ciapponi, Santiago Martinez Balvanera, Andrea Cesaretti, Elisabetta Farella, Kate E. Jones: Bad: Taming the Bioacoustic Data Deluge with a Bat Acticity Detector arxiv.org/abs/2609.37518 arxiv.org/pdf/2609.37518 arxiv.org/html/2609.37518
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 30/09/2026
Gouthaman KV, Shiv Gehlot, Vishnu Raj, Lars Villemoes, Arijit Biswas: Multichannel Audio Quality Assessment: Extending Pretrained Perceptual Models to Spatial Audio arxiv.org/abs/2609.37116 arxiv.org/pdf/2609.37116 arxiv.org/html/2609.37116
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 30/09/2026
Yulin Sun, Kele Xu, Yong Dou: Prediction-Layer Branch Calibration for Multimodal Sentiment Analysis arxiv.org/abs/2609.37100 arxiv.org/pdf/2609.37100 arxiv.org/html/2609.37100
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 30/09/2026
Maxim Maslov, Kirill Borodin, Vasilii Kudryavtsev, Nikita Vasiliev, Grach Mkrtchian: RAWD-TTS: Ratio-Free Reward Alignment for Discrete-Diffusion Voice Cloning arxiv.org/abs/2609.37028 arxiv.org/pdf/2609.37028 arxiv.org/html/2609.37028
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 30/09/2026
Kirill Borodin, Vasilii Kudryavtsev, Maxim Maslov, Grach Mkrtchian: ReDimNet2+: Multi-Corpus Data Scaling for Robust Speaker Verification arxiv.org/abs/2609.37014 arxiv.org/pdf/2609.37014 arxiv.org/html/2609.37014
000
arXiv cs.SD Sound @cssd-bot.bsky.social · 30/09/2026
Berkin Durmus, Eduardo Pacheco, Zach Nagengast, Atila Orhon: RVQ Position Aware Speculative Decoding for On Device Text to Speech arxiv.org/abs/2609.37007 arxiv.org/pdf/2609.37007 arxiv.org/html/2609.37007
000