这是一个公共 AI 对话归档与导出工具库,收集了 Claude、Grok、Kimi、Qwen、DeepSeek 和少量 Google AI Studio 的公开/手工转录对话,并统一导出为 Markdown。仓库当前包含约 1,528 个对话、16,394 条消息、约 66MB 数据,同时提供 6 个 Python 脚本用于从分享链接或原始页面文本中生成标准化 Markdown 对话文件。它更像是一个“AI 公开对话数据集 + 多平台分享链接转录工具”的组合项目。
适用领域
AI 对话数据集 / 大模型应用研究 / 数据归档 / 文本数据处理 / Markdown 转换 / 爬虫/网页数据提取 / LLM 评测与提示词研究 / AI 安全与公开内容分析
配置难度
中等。作为数据集直接使用比较简单;运行导出脚本需要基本 Python、命令行和依赖安装经验;如果要维护抓取逻辑、适配平台 API 变更或做大规模数据清洗,则需要较强的数据工程和爬虫经验。
商业价值
对中文开发者的商业价值主要体现在数据资产和工具复用上:可以快速获得多平台真实 AI 对话样本,用于构建提示词案例库、AI 对话搜索产品、LLM 行为分析工具、评测基准、内容安全审查样本或内部知识库原型。但由于 license 缺失、数据来源复杂和潜在隐私/版权风险,不建议未经审查直接用于商业模型训练或公开产品数据源;更适合作为研究、原型验证、数据格式参考和内部分析工具基础。
01
技术亮点
- 已内置较大规模公开 AI 对话归档,覆盖 Claude、Grok、Kimi、Qwen、DeepSeek 等多个主流模型平台
- 所有对话统一转成 Markdown,便于阅读、检索、版本管理和二次处理
- 每个平台都有单独导出脚本,结构清晰,方便扩展到新平台
- 支持 manifest 机制,重复运行时会跳过已处理对话,适合增量归档
- 文件名保留原始标题和原始语言,包括中文、韩文等非拉丁字符,有利于保持语料真实性
- 对不同平台的特殊内容有适配,如 Grok 图片/来源、Kimi 工具调用、Qwen/DeepSeek reasoning 内容、AI Studio 附件标记等
- README 对各平台抓取机制、API 差异、Cloudflare/AWS WAF 限制解释得很清楚,对爬虫和数据工程开发者有参考价值
- 数据格式简单,容易接入 Python、全文搜索、向量数据库、LLM 评测流程
02
目标用户
- 研究 Claude、Grok、Kimi、Qwen、DeepSeek 等模型输出风格的开发者
- 需要收集公开 AI 对话作为语料的中文 NLP/LLM 研究者
- 想构建 AI 对话检索、分析、标注或 RAG 数据库的工程师
- 关注提示词工程、模型回答模式和公开分享内容的数据分析人员
- 希望批量备份自己公开分享对话的高级用户
- 需要跨平台统一 Markdown 对话格式的工具开发者
03
配置要求
- 需要 Python 3 环境
- 需要安装 requirements.txt 中的依赖;Claude 和 Grok 导出依赖 curl_cffi,用于浏览器 TLS 指纹模拟
- Kimi、Qwen、DeepSeek 导出主要依赖 requests
- 输入文件要求每行一个分享链接,空行和以 # 开头的注释会被忽略
- 不同平台需要使用对应脚本和对应输出目录
- Claude、Qwen、DeepSeek 可选 --include-thinking 以导出可见的 thinking/reasoning 内容
- Grok 可选 --include-sources 以导出网页和 X 引用来源
- Google AI Studio 没有公开分享 API,需要用户登录后手工复制页面文本到 raw_google_dumps/,再运行 aistudio_export.py
- 只支持公开可访问的分享链接;私有、撤销、失效链接无法导出
- Qwen 的 /s/deploy/ artifact 分享不支持转换为普通聊天 Markdown
04
适用场景
- 将 Claude、Grok、Kimi、Qwen、DeepSeek 的公开分享链接批量导出为 Markdown 文件
- 构建本地 AI 对话语料库,用于检索、统计、聚类、主题分析或 RAG
- 分析不同大模型在真实用户问题上的回答风格、长度、结构和引用习惯
- 收集提示词案例,用于提示词工程学习、教学或案例库建设
- 将公开 AI 聊天记录转为统一格式,方便导入 Obsidian、Notion、向量数据库或数据分析管道
- 研究公开分享链接的底层 API、反爬机制和导出方式
- 对 Google AI Studio 的手工复制文本进行清洗并转换为结构化 Markdown
05
部署与配置
- 克隆仓库:git clone https://github.com/fuadmefleh/Shared-Claude-Chats.git
- 进入目录:cd Shared-Claude-Chats
- 建议创建 Python 虚拟环境:python3 -m venv .venv && source .venv/bin/activate
- 安装依赖:pip install -r requirements.txt
- 将需要导出的分享链接按平台放入对应 link_lists/*.txt 文件中,或直接使用仓库已有链接列表
- 运行对应脚本,例如:python3 scripts/claude_share_export.py link_lists/claudeaisharelinks.txt -o claude_chats
- Grok 示例:python3 scripts/grok_share_export.py link_lists/grokaisharelinks.txt -o grok_chats
- Kimi 示例:python3 scripts/kimi_share_export.py link_lists/kimiaisharelinks.txt -o kimi_chats
- Qwen 示例:python3 scripts/qwen_share_export.py link_lists/qwenaisharelinks.txt -o qwen_chats
- DeepSeek 示例:python3 scripts/deepseek_share_export.py link_lists/deepseeksharelinks.txt -o deepseek_chats
- 如需重新抓取已归档但可能更新过的对话,可加 --force 参数
06
风险与注意事项
- 仓库没有明确 license,商用、再分发或训练用途存在版权和合规不确定性
- 归档内容来自公开分享或手工复制,可能包含个人信息、敏感内容、版权材料或不适合再利用的数据
- 公开分享链接的 API 和反爬机制可能随平台更新而失效,导出脚本稳定性依赖外部平台
- Claude 和 Grok 依赖 curl_cffi 绕过 TLS 指纹限制,可能触及平台服务条款边界
- 数据不是严格清洗后的高质量训练集,可能包含重复、错误、幻觉、偏见或恶意提示内容
- 仓库中的对话是快照,不是实时同步;原始分享更新后需要 --force 重新抓取
- Google AI Studio 部分依赖手工复制,容易漏内容或格式不一致
- 如果用于模型训练或评测,需要额外进行脱敏、去重、版权审查和数据质量评估
2026-07-30
第7名
新收录 · github_search
2026-07-29
第12名
新收录 · github_search