python/FunASR-XL.git

			@@ -21,14 +21,12 @@
			token_type=char
			scp=wav.scp
			type=sound
			stage=1
			stop_stage=1
			stage=2
			stop_stage=3

			# feature configuration
			feats_dim=80
			sample_frequency=16000
			nj=64
			speed_perturb="0.9,1.0,1.1"

			# data
			raw_data=
			@@ -102,11 +100,9 @@
			echo "<blank>" > ${token_list}
			echo "<s>" >> ${token_list}
			echo "</s>" >> ${token_list}
			utils/text2token.py -s 1 -n 1 --space "" ${feats_dir}/data/train/text \| cut -f 2- -d" " \| tr " " "\n" \
			utils/text2token.py -s 1 -n 1 --space "" ${feats_dir}/data/$train_set/text \| cut -f 2- -d" " \| tr " " "\n" \
			\| sort \| uniq \| grep -a -v -e '^\s*$' \| awk '{print $0}' >> ${token_list}
			num_token=$(cat ${token_list} \| wc -l)
			echo "<unk>" >> ${token_list}
			vocab_size=$(cat ${token_list} \| wc -l)
			fi

			# Training Stage
			@@ -135,7 +131,7 @@
			--data_dir ${feats_dir}/data \
			--train_set ${train_set} \
			--valid_set ${valid_set} \
			--cmvn_file ${feats_dir}/cmvn/cmvn.mvn \
			--cmvn_file ${feats_dir}/data/${train_set}/cmvn/cmvn.mvn \
			--resume true \
			--output_dir ${exp_dir}/exp/${model_dir} \
			--config $asr_config \