游雁
2023-07-01 c89c9d3c25e9d9ccb1ff5a34fd3e118b41df8505
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
€•,Œsphinx.addnodes”Œdocument”“”)”}”(Œ    rawsource”Œ”Œchildren”]”Œdocutils.nodes”Œsection”“”)”}”(hhh]”(h    Œtitle”“”)”}”(hŒ赛道设置与评估”h]”h    ŒText”“”Œ赛道设置与评估”…””}”(Œparent”hŒ    _document”hŒsource”NŒline”NubaŒ
attributes”}”(Œids”]”Œclasses”]”Œnames”]”Œdupnames”]”Œbackrefs”]”uŒtagname”hhKhŒ;/mnt/yhliang/FunASR/docs/m2met2_cn/赛道设置与评估.md”hh hhubh )”}”(hhh]”(h)”}”(hŒ说话人相关的语音识别”h]”hŒ说话人相关的语音识别”…””}”(hh0hhhNhNubah}”(h!]”h#]”h%]”h']”h)]”uh+hhKhh,hh-hhubh    Œ    paragraph”“”)”}”(hX说话人相关的ASR任务需要从重叠的语音中识别每个说话人的语音,并为识别内容分配一个说话人标签。图2展示了说话人相关语音识别任务和多说话人语音识别任务的主要区别。在本次竞赛中AliMeeting、Aishell4和Cn-Celeb数据集可作为受限数据源。在M2MeT挑战赛中使用的AliMeeting数据集包含训练、评估和测试集,在M2MeT2.0可以在训练和评估中使用。此外,一个包含约10小时会议数据的新的Test-2023集将根据赛程安排发布并用于挑战赛的评分和排名。值得注意的是,对于Test-2023测试集,主办方将不再提供耳机的近场音频、转录以及真实时间戳。而是提供可以通过一个简单的VAD模型得到的包含多个说话人的片段。”h]”hX说话人相关的ASR任务需要从重叠的语音中识别每个说话人的语音,并为识别内容分配一个说话人标签。图2展示了说话人相关语音识别任务和多说话人语音识别任务的主要区别。在本次竞赛中AliMeeting、Aishell4和Cn-Celeb数据集可作为受限数据源。在M2MeT挑战赛中使用的AliMeeting数据集包含训练、评估和测试集,在M2MeT2.0可以在训练和评估中使用。此外,一个包含约10小时会议数据的新的Test-2023集将根据赛程安排发布并用于挑战赛的评分和排名。值得注意的是,对于Test-2023测试集,主办方将不再提供耳机的近场音频、转录以及真实时间戳。而是提供可以通过一个简单的VAD模型得到的包含多个说话人的片段。”…””}”(hh@hhhNhNubah}”(h!]”h#]”h%]”h']”h)]”uh+h>hKhh,hh-hhubh?)”}”(hŒ(![task difference](images/task_diff.png)”h]”h    Œimage”“”)”}”(hŒtask difference”h]”h}”(h!]”h#]”h%]”h']”h)]”Œuri”Œimages/task_diff.png”Œalt”hVŒ
candidates”}”Œ*”h_suh+hRhKhh,hhNhhubah}”(h!]”h#]”h%]”h']”h)]”uh+h>hKhh,hh-hhubeh}”(h!]”Œid2”ah#]”h%]”Œ说话人相关的语音识别”ah']”h)]”Œslug”Œ说话人相关的语音识别”uh+h
hKhh,hh hhubh )”}”(hhh]”(h)”}”(hŒ 评估方法”h]”hŒ 评估方法”…””}”(hhwhhhNhNubah}”(h!]”h#]”h%]”h']”h)]”uh+hhKhh,hhthhubh?)”}”(hXˆ使用串联最优排序字符错误率(cpCER)指标来评估说话人相关的ASR系统的准确性。cpCER的计算包括三个步骤。首先,将一场会议中每个说话人的参考和假设转录按时间顺序串联起来。其次,计算真实标签和预测输出之间的字符错误率(CER),并对所有可能的说话人排列组合重复这一过程。最后,选择CER最低的排列组合作为该时段的cpCER。CER是通过将ASR输出转化为参考抄本所需的插入(Ins)、替换(Sub)和删除(Del)的字符总数除以参考抄本的字符总数得到的。具体来说,CER的计算方法是:”h]”hXˆ使用串联最优排序字符错误率(cpCER)指标来评估说话人相关的ASR系统的准确性。cpCER的计算包括三个步骤。首先,将一场会议中每个说话人的参考和假设转录按时间顺序串联起来。其次,计算真实标签和预测输出之间的字符错误率(CER),并对所有可能的说话人排列组合重复这一过程。最后,选择CER最低的排列组合作为该时段的cpCER。CER是通过将ASR输出转化为参考抄本所需的插入(Ins)、替换(Sub)和删除(Del)的字符总数除以参考抄本的字符总数得到的。具体来说,CER的计算方法是:”…””}”(hh…hhhNhNubah}”(h!]”h#]”h%]”h']”h)]”uh+h>hKhh,hhthhubh    Œ
math_block”“”)”}”(hŒŒ \text{CER} = \frac {\mathcal N_{\text{Ins}} + \mathcal N_{\text{Sub}} + \mathcal N_{\text{Del}} }{\mathcal N_{\text{Total}}} \times 100\%, ”h]”hŒŒ \text{CER} = \frac {\mathcal N_{\text{Ins}} + \mathcal N_{\text{Sub}} + \mathcal N_{\text{Del}} }{\mathcal N_{\text{Total}}} \times 100\%, ”…””}”hh•sbah}”(h!]”h#]”h%]”h']”h)]”Œnowrap”‰Œnumber”NŒ    xml:space”Œpreserve”uh+h“hK
hh,hhthhubh?)”}”(hŒ¢å…¶ä¸­ $\mathcal N_{\text{Ins}}$ , $\mathcal N_{\text{Sub}}$ , $\mathcal N_{\text{Del}}$ æ˜¯ä¸‰ç§é”™è¯¯çš„字符数, $\mathcal N_{\text{Total}}$ æ˜¯å­—符总数.”h]”(hŒ其中 ”…””}”(hh§hhhNhNubh    Œmath”“”)”}”(hŒ\mathcal N_{\text{Ins}}”h]”hŒ\mathcal N_{\text{Ins}}”…””}”(hh±hhhNhNubah}”(h!]”h#]”h%]”h']”h)]”uh+h¯hK hh,hh§hhubhŒ , ”…””}”(hh§hhhNhNubh°)”}”(hŒ\mathcal N_{\text{Sub}}”h]”hŒ\mathcal N_{\text{Sub}}”…””}”(hhÃhhhNhNubah}”(h!]”h#]”h%]”h']”h)]”uh+h¯hK hh,hh§hhubhŒ , ”…””}”(hh§hhhh,hKubh°)”}”(hŒ\mathcal N_{\text{Del}}”h]”hŒ\mathcal N_{\text{Del}}”…””}”(hhÕhhhNhNubah}”(h!]”h#]”h%]”h']”h)]”uh+h¯hK hh,hh§hhubhŒ æ˜¯ä¸‰ç§é”™è¯¯çš„字符数, ”…””}”(hh§hhhNhNubh°)”}”(hŒ\mathcal N_{\text{Total}}”h]”hŒ\mathcal N_{\text{Total}}”…””}”(hhçhhhNhNubah}”(h!]”h#]”h%]”h']”h)]”uh+h¯hK hh,hh§hhubhŒ æ˜¯å­—符总数.”…””}”(hh§hhhNhNubeh}”(h!]”h#]”h%]”h']”h)]”uh+h>hK hh,hhthhubeh}”(h!]”Œid3”ah#]”h%]”Œ 评估方法”ah']”h)]”hrŒ 评估方法”uh+h
hKhh,hh hhubh )”}”(hhh]”(h)”}”(hŒ子赛道设置”h]”hŒ子赛道设置”…””}”(hj hhhNhNubah}”(h!]”h#]”h%]”h']”h)]”uh+hhK hh,hjhhubh )”}”(hhh]”(h)”}”(hŒ"子赛道一 (限定训练数据):”h]”hŒ"子赛道一 (限定训练数据):”…””}”(hjhhhNhNubah}”(h!]”h#]”h%]”h']”h)]”uh+hhKhh,hjhhubh?)”}”(hX‡参赛者在系统构建过程中仅能使用AliMeeting、AISHELL-4和CN-Celeb,严禁使用额外数据。参赛者可以任何第三方开源的预训练模型,如[Hugging Face](https://huggingface.co/models)以及[ModelScope](https://www.modelscope.cn/models)上提供的模型。参赛者需要在最终的系统描述文档中详细列出使用的预训练模型名称以及链接。”h]”(hŒ¨å‚赛者在系统构建过程中仅能使用AliMeeting、AISHELL-4和CN-Celeb,严禁使用额外数据。参赛者可以任何第三方开源的预训练模型,如”…””}”(hj*hhhNhNubh    Œ    reference”“”)”}”(hŒ Hugging Face”h]”hŒ Hugging Face”…””}”(hj4hhhNhNubah}”(h!]”h#]”h%]”h']”h)]”Œrefuri”Œhttps://huggingface.co/models”uh+j2hKhh,hj*hhubhŒ以及”…””}”(hj*hhhNhNubj3)”}”(hŒ
ModelScope”h]”hŒ
ModelScope”…””}”(hjHhhhNhNubah}”(h!]”h#]”h%]”h']”h)]”jBŒ https://www.modelscope.cn/models”uh+j2hKhh,hj*hhubhŒ~上提供的模型。参赛者需要在最终的系统描述文档中详细列出使用的预训练模型名称以及链接。”…””}”(hj*hhhNhNubeh}”(h!]”h#]”h%]”h']”h)]”uh+h>hKhh,hjhhubeh}”(h!]”Œid5”ah#]”h%]”Œ"子赛道一 (限定训练数据):”ah']”h)]”uh+h
hKhh,hjhhubh )”}”(hhh]”(h)”}”(hŒ"子赛道二 (开放训练数据):”h]”hŒ"子赛道二 (开放训练数据):”…””}”(hjlhhhNhNubah}”(h!]”h#]”h%]”h']”h)]”uh+hhKhh,hjihhubh?)”}”(hX•除了限定数据外,参与者可以使用任何公开可用、私人录制和模拟仿真的数据集。但是,参与者必须清楚地列出使用的数据。同样,参赛者也可以使用任何第三方开源的预训练模型,但必须在最后的系统描述文件中明确的列出所使用的数据和模型链接,如果使用模拟仿真数据,请详细描述数据模拟的方案。”h]”hX•除了限定数据外,参与者可以使用任何公开可用、私人录制和模拟仿真的数据集。但是,参与者必须清楚地列出使用的数据。同样,参赛者也可以使用任何第三方开源的预训练模型,但必须在最后的系统描述文件中明确的列出所使用的数据和模型链接,如果使用模拟仿真数据,请详细描述数据模拟的方案。”…””}”(hjzhhhNhNubah}”(h!]”h#]”h%]”h']”h)]”uh+h>hKhh,hjihhubeh}”(h!]”Œid6”ah#]”h%]”Œ"子赛道二 (开放训练数据):”ah']”h)]”uh+h
hKhh,hjhhubeh}”(h!]”Œid4”ah#]”h%]”Œ子赛道设置”ah']”h)]”hrŒ子赛道设置”uh+h
hK hh,hh hhubeh}”(h!]”Œid1”ah#]”h%]”Œ赛道设置与评估”ah']”h)]”hrŒ赛道设置与评估”uh+h
hKhh,hhhhubah}”(h!]”h#]”h%]”h']”h)]”Œsource”h,uh+hŒcurrent_source”NŒ current_line”NŒsettings”Œdocutils.frontend”ŒValues”“”)”}”(hNŒ    generator”NŒ    datestamp”NŒ source_link”NŒ
source_url”NŒ toc_backlinks”Œentry”Œfootnote_backlinks”KŒ sectnum_xform”KŒstrip_comments”NŒstrip_elements_with_classes”NŒ strip_classes”NŒ report_level”KŒ
halt_level”KŒexit_status_level”KŒdebug”NŒwarning_stream”NŒ    traceback”ˆŒinput_encoding”Œ    utf-8-sig”Œinput_encoding_error_handler”Œstrict”Œoutput_encoding”Œutf-8”Œoutput_encoding_error_handler”jÅŒerror_encoding”ŒUTF-8”Œerror_encoding_error_handler”Œbackslashreplace”Œ language_code”Œzh_CN”Œrecord_dependencies”NŒconfig”NŒ    id_prefix”hŒauto_id_prefix”Œid”Œ dump_settings”NŒdump_internals”NŒdump_transforms”NŒdump_pseudo_xml”NŒexpose_internals”NŒstrict_visitor”NŒ_disable_config”NŒ_source”h,Œ _destination”NŒ _config_files”]”Œfile_insertion_enabled”ˆŒ raw_enabled”KŒline_length_limit”M'Œpep_references”NŒ pep_base_url”Œhttps://peps.python.org/”Œpep_file_url_template”Œpep-%04d”Œrfc_references”NŒ rfc_base_url”Œ&https://datatracker.ietf.org/doc/html/”Œ    tab_width”KŒtrim_footnote_reference_space”‰Œsyntax_highlight”Œlong”Œ smart_quotes”ˆŒsmartquotes_locales”]”Œcharacter_level_inline_markup”‰Œdoctitle_xform”‰Œ docinfo_xform”KŒsectsubtitle_xform”‰Œ image_loading”Œlink”Œembed_stylesheet”‰Œcloak_email_addresses”ˆŒsection_self_link”‰Œenv”NubŒreporter”NŒindirect_targets”]”Œsubstitution_defs”}”(Œwordcount-words”h    Œsubstitution_definition”“”)”}”(hŒ15”h]”hŒ15”…””}”hjsbah}”(h!]”h#]”h%]”Œwordcount-words”ah']”h)]”uh+jhh,ubŒwordcount-minutes”j)”}”(hŒ0”h]”hŒ0”…””}”hjsbah}”(h!]”h#]”h%]”Œwordcount-minutes”ah']”h)]”uh+jhh,ubuŒsubstitution_names”}”(Œwordcount-words”jŒwordcount-minutes”juŒrefnames”}”Œrefids”}”Œnameids”}”(jžj›hohljjj•j’jfjcjjŠuŒ    nametypes”}”(jž‰ho‰j‰j•‰jf‰j‰uh!}”(j›h hlh-jhtj’jjcjjŠjiuŒ footnote_refs”}”Œ citation_refs”}”Œ autofootnotes”]”Œautofootnote_refs”]”Œsymbol_footnotes”]”Œsymbol_footnote_refs”]”Œ    footnotes”]”Œ    citations”]”Œautofootnote_start”KŒsymbol_footnote_start”KŒ
id_counter”Œ collections”ŒCounter”“”}”jÓKs…”R”Œparse_messages”]”Œtransform_messages”]”Œ transformer”NŒ include_log”]”Œ
decoration”NhhŒ
myst_slugs”}”(j¡Kj›Œ赛道设置与评估”‡”hsKhlŒ说话人相关的语音识别”‡”jKjŒ 评估方法”‡”j˜K j’Œ子赛道设置”‡”uub.