任职要求
1. 本科及以上在读,计算机、人工智能、电子信息、数字媒体、声学或相关专业。
2. 熟悉 Python,具备基本的工程开发和调试能力。
3. 对 TTS、语音识别、音频生成或数字信号处理有一定了解,至少实践过一个相关项目。
4. 熟悉常见音频基础概念,如采样率、频谱、梅尔频谱、响度、信噪比、混响等。
5. 能够使用 FFmpeg、Librosa、PyTorch、Torchaudio 等音频或深度学习工具中的一种或多种。
6. 具备较强的学习、调研和问题分析能力,能够将模糊的效果问题拆解为可验证的技术问题。
7. 对 AI 音频技术有浓厚兴趣,愿意持续体验、对比和改进不同模型及工具。
【加分项】
1. 有 TTS、声音克隆、语音转换、音频修复或音乐生成相关项目经验。
2. 使用或研究过 CosyVoice、Fish Speech、F5-TTS、GPT-SoVITS、XTTS、Whisper、Demucs 等模型或工具。
3. 了解音素、韵律、强制对齐、说话人表征、多语种文本前端等语音技术。
4. 有音频主观评测、MOS 评测、AB 测试或自动化质量评测经验。
5. 具备前端、后端或桌面工具开发能力,能够独立完成可供业务人员使用的原型工具。
6. 熟悉日语、韩语或其他外语,能够判断对应语言的发音和表达问题。
7. 在 GitHub、论文复现、开源项目或技术竞赛中有相关成果。
8. 熟悉常见音频编辑处理工具如DAW(Pro Tools/Cubase)、Audacit/Audition、iZotope RX、Wwise等。