WeClone:用你的微信聊天记录微调出数字分身,30分钟搭出能回话的API
【免费下载链接】WeClone🚀 One-stop solution for creating your AI twin from chat history 💡 Fine-tune LLMs with your chat logs to capture your unique style, then bind to a chatbot to bring your digital self to life.项目地址: https://gitcode.com/GitHub_Trending/we/WeClone
把你自己的微信聊天记录导出来,WeClone 能在 30 分钟里给你搭一个数字分身。它用你的数据微调大语言模型(用你自己的数据训练现成模型),得到一个和你说话很像的 AI。接到微信上替你回消息,或包装成 API 给别人调用。
💡 它能帮你做什么
- 训练你的“AI 分身”:把聊天记录喂给模型,它会学你的说话风格、语气和应答习惯。
- 替你在微信里回话:模型接到微信账号上,私聊、群聊@它都会自动回复。
- 提供对话 API:训练完起一条命令,模型就能变成任何程序都能调的服务(API:把能力包成接口)。
- 多种姿势体验:命令行里直接聊、网页上预览、接口里调用。
🚀 30分钟从零到能跑
第 1 步:拿到代码。没有 Python 3.8 以上环境就先装一个,打开终端执行:
git clone https://gitcode.com/GitHub_Trending/we/WeClone cd WeClone第 2 步:装依赖。微调框架和微信接口都写在 requirements.txt 里,一条命令装齐:
pip install -r requirements.txt第 3 步:准备聊天记录。把微信会话导出成 CSV 放进 data/ 目录,再执行转换脚本:
python make_dataset/csv_to_json.py多轮数据可改用 csv_to_json-单句多轮.py 处理。
💬 三种玩法试用数字分身
先执行python src/train_sft.py完成监督微调(照着数据学答题),跑完就能用下面三种方式体验。
命令行里聊两句
执行这条命令:
python src/cli_demo.py启动后直接输入问题,模型会逐句作答。输入exit退出,clear清空对话历史。
接到微信上替你回话
先启动 API 服务,再跑机器人:
python src/api_service.py python src/wechat_bot/main.py终端会显示二维码,用微信扫码登录,这个账号私聊、群聊里被@都会自动回复。
在网页里预览数字分身
执行这条命令:
python src/web_demo.py浏览器打开一个网页聊天界面,直接看数字分身的说话风格。想快速验收,跑一下python src/test_model.py。
⚙️ 想微调得更好:训练和配置可调项
只想用默认配置就跳过这节;想折腾再看这里。
- 底座模型是 ChatGLM3-6b,LoRA 微调(轻量微调方法)大约要 16GB 显存。
- 训练和推理参数都集中在 settings.json,多卡训练配合 ds_config.json。
- 训练入口:监督微调 src/train_sft.py,预训练 src/train_pt.py。
- 数据处理脚本都在 make_dataset/ 目录里。
📌 用之前记住这几件事
- 聊天记录是个人隐私,只导你愿意公开的会话,文件放好;流程默认会去掉手机号、身份证号、邮箱、网址。
- 微信登录有封号风险,用小号,且账号要绑定过银行卡。
- 响应慢先关占用资源的程序,或调小 settings.json 里的批量参数。
- 数据里有效消息太少,效果有限,聊天量越大、质量越好,风格越像你。
跑通之后,你的微信就多了一个 24 小时在线的分身,消息不用你亲自回。
【免费下载链接】WeClone🚀 One-stop solution for creating your AI twin from chat history 💡 Fine-tune LLMs with your chat logs to capture your unique style, then bind to a chatbot to bring your digital self to life.项目地址: https://gitcode.com/GitHub_Trending/we/WeClone
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考