音频编码器是多模态大模型的重要组件,优秀的音频编码器在构建多模态系统中至关重要。在此背景下,小米集团、萨里大学、海天瑞声共同主办了 IEEE International Conference on Multimedia & Expo (ICME) 2025 Audio Encoder Capability Challenge。
IEEE ICME 2025 会议将于今年7月在法国南特举办,聚焦人工智能驱动的多媒体技术,涵盖图像与视频处理、多媒体分析与生成、社交媒体分析等AI相关主题。本挑战赛依托于会议平台,旨在评估音频编码器在丰富的多样性任务中的表征能力。届时,我们将在会议现场举办线下workshop,邀请优秀参赛队伍做技术报告。

挑战赛受 HEAR benchmark 启发,引入了多项增强,包括多样化的任务集、面向真实世界的应用、微调和 zero-shot 评估相结合,以及一个新的高效的开源评估系统。参赛者需提交输入为波形、输出为连续嵌入向量的音频编码器,我们将采用带参数和无参数两种评估方法,在语音、环境声音和音乐等多个任务上衡量编码器的性能。
挑战赛不限制模型尺寸和训练数据规模,并且允许基于任何公开的预训练模型,只需最终模型能够在 Google Colab 上推理、训练数据中不包含指定测试集。

最低0.47元/天 解锁文章
940

被折叠的 条评论
为什么被折叠?



