使用ChatGLMTokenizer处理json格式数据

我下载了一些中文wikipedia数据，准备采用ChatGLMTokenizer对齐进行清洗，整理为预训练语料。

import numpy as np
import json
from tqdm import tqdm
from chatglm_tokenizer.tokenization_chatglm import ChatGLMTokenizer

tokenizer = ChatGLMTokenizer(vocab_file='./chatglm_tokenizer/tokenizer.model')

with open('./data/wikipedia-cn-20230720-filtered.json') as f:
    data = json.load(f)
    print(data[0:3])
    data = data[0:3]
    doc_ids = []
    for line in tqdm(data):
        text = line['completion']
        text_id = tokenizer.encode(text, add_special_tokens=False)
        text_id.append(tokenizer.special_tokens[''])
        # doc_ids = doc_ids+text_id
        doc_ids.append(doc_ids)
    doc_ids = np.array(doc_ids, dtype=np.uint16)

    with open('./test.bin', 'wb') as f:
        f.write(doc_ids.tobytes())

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23

其中，chatglm_tokenizer目录下的文件如下：
在这里插入图片描述

相关阅读:
vue用户点击后下载前端项目中的文件
【SwiftUI模块】0024、SwiftUI创建一个时尚的3D轮播滑块
购买油封时必须了解的步骤
Burp插件HaE与Authz用法
【华为OD机试真题 python】解密犯罪时间【2022 Q4 | 100分】
MySQL数据库cpu飙升的话，要怎么处理呢？
基于HBuilderX+UniApp+ThorUI的手机端前端的页面组件化开发经验
目标检测（3）—— 如何使用PyTorch加载COCO类型的数据集
PyTorch深度学习实践1——线性回归和Logistic回归
浅谈Unity UI适配（二）

原文地址：https://blog.csdn.net/weixin_44612221/article/details/132736405