python/FunASR-XL.git

FUNASR训练

parent: 55b45487 | 补丁 | 提交 | show whitespace

jmwang66

2023-02-07 ded881802c82190681a1f37caf1edefb16e67491

update data2vec pretrain

2个文件已修改

	funasr/datasets/large_datasets/datapipes/batch.py	1 ●●●●● 补丁 \| 查看 \| 原始文档 \| blame \| 历史
	funasr/datasets/large_datasets/dataset.py	1 ●●●●● 补丁 \| 查看 \| 原始文档 \| blame \| 历史

 funasr/datasets/large_datasets/datapipes/batch.py

@@ -46,6 +46,7 @@
        batch = []
        bucket = []
        max_lengths = 0
        min_lengths = 999999
        batch_lengths = 0

        if self.batch_mode == "clipping":

 funasr/datasets/large_datasets/dataset.py

@@ -158,6 +158,7 @@
    filter_fn = partial(filter, **filter_conf)
    dataset = FilterIterDataPipe(dataset, fn=filter_fn)

    if "text" in data_names:
    vocab = {'vocab': dict, 'seg_dict': seg_dict}
    tokenize_fn = partial(tokenize, **vocab)
    dataset = MapperIterDataPipe(dataset, fn=tokenize_fn)

			@@ -46,6 +46,7 @@
			batch = []
			bucket = []
			max_lengths = 0
			min_lengths = 999999
			batch_lengths = 0

			if self.batch_mode == "clipping":

			@@ -158,6 +158,7 @@
			filter_fn = partial(filter, **filter_conf)
			dataset = FilterIterDataPipe(dataset, fn=filter_fn)

			if "text" in data_names:
			vocab = {'vocab': dict, 'seg_dict': seg_dict}
			tokenize_fn = partial(tokenize, **vocab)
			dataset = MapperIterDataPipe(dataset, fn=tokenize_fn)