Python · 项目报告

fuadmefleh/Shared-Claude-Chats

An archive of public Claude and Grok conversations, exported from their share links as plain markdown, plus the two scripts that produce it.

已完成 打开 GitHub
F
922星标
147Fork
1Issue
未知许可证

分析结果

项目分析

这是一个公共 AI 对话归档与导出工具库,收集了 Claude、Grok、Kimi、Qwen、DeepSeek 和少量 Google AI Studio 的公开/手工转录对话,并统一导出为 Markdown。仓库当前包含约 1,528 个对话、16,394 条消息、约 66MB 数据,同时提供 6 个 Python 脚本用于从分享链接或原始页面文本中生成标准化 Markdown 对话文件。它更像是一个“AI 公开对话数据集 + 多平台分享链接转录工具”的组合项目。

适用领域 AI 对话数据集 / 大模型应用研究 / 数据归档 / 文本数据处理 / Markdown 转换 / 爬虫/网页数据提取 / LLM 评测与提示词研究 / AI 安全与公开内容分析
配置难度 中等。作为数据集直接使用比较简单;运行导出脚本需要基本 Python、命令行和依赖安装经验;如果要维护抓取逻辑、适配平台 API 变更或做大规模数据清洗,则需要较强的数据工程和爬虫经验。
商业价值 对中文开发者的商业价值主要体现在数据资产和工具复用上:可以快速获得多平台真实 AI 对话样本,用于构建提示词案例库、AI 对话搜索产品、LLM 行为分析工具、评测基准、内容安全审查样本或内部知识库原型。但由于 license 缺失、数据来源复杂和潜在隐私/版权风险,不建议未经审查直接用于商业模型训练或公开产品数据源;更适合作为研究、原型验证、数据格式参考和内部分析工具基础。
01

技术亮点

  • 已内置较大规模公开 AI 对话归档,覆盖 Claude、Grok、Kimi、Qwen、DeepSeek 等多个主流模型平台
  • 所有对话统一转成 Markdown,便于阅读、检索、版本管理和二次处理
  • 每个平台都有单独导出脚本,结构清晰,方便扩展到新平台
  • 支持 manifest 机制,重复运行时会跳过已处理对话,适合增量归档
  • 文件名保留原始标题和原始语言,包括中文、韩文等非拉丁字符,有利于保持语料真实性
  • 对不同平台的特殊内容有适配,如 Grok 图片/来源、Kimi 工具调用、Qwen/DeepSeek reasoning 内容、AI Studio 附件标记等
  • README 对各平台抓取机制、API 差异、Cloudflare/AWS WAF 限制解释得很清楚,对爬虫和数据工程开发者有参考价值
  • 数据格式简单,容易接入 Python、全文搜索、向量数据库、LLM 评测流程
02

目标用户

  • 研究 Claude、Grok、Kimi、Qwen、DeepSeek 等模型输出风格的开发者
  • 需要收集公开 AI 对话作为语料的中文 NLP/LLM 研究者
  • 想构建 AI 对话检索、分析、标注或 RAG 数据库的工程师
  • 关注提示词工程、模型回答模式和公开分享内容的数据分析人员
  • 希望批量备份自己公开分享对话的高级用户
  • 需要跨平台统一 Markdown 对话格式的工具开发者
03

配置要求

  • 需要 Python 3 环境
  • 需要安装 requirements.txt 中的依赖;Claude 和 Grok 导出依赖 curl_cffi,用于浏览器 TLS 指纹模拟
  • Kimi、Qwen、DeepSeek 导出主要依赖 requests
  • 输入文件要求每行一个分享链接,空行和以 # 开头的注释会被忽略
  • 不同平台需要使用对应脚本和对应输出目录
  • Claude、Qwen、DeepSeek 可选 --include-thinking 以导出可见的 thinking/reasoning 内容
  • Grok 可选 --include-sources 以导出网页和 X 引用来源
  • Google AI Studio 没有公开分享 API,需要用户登录后手工复制页面文本到 raw_google_dumps/,再运行 aistudio_export.py
  • 只支持公开可访问的分享链接;私有、撤销、失效链接无法导出
  • Qwen 的 /s/deploy/ artifact 分享不支持转换为普通聊天 Markdown
04

适用场景

  • 将 Claude、Grok、Kimi、Qwen、DeepSeek 的公开分享链接批量导出为 Markdown 文件
  • 构建本地 AI 对话语料库,用于检索、统计、聚类、主题分析或 RAG
  • 分析不同大模型在真实用户问题上的回答风格、长度、结构和引用习惯
  • 收集提示词案例,用于提示词工程学习、教学或案例库建设
  • 将公开 AI 聊天记录转为统一格式,方便导入 Obsidian、Notion、向量数据库或数据分析管道
  • 研究公开分享链接的底层 API、反爬机制和导出方式
  • 对 Google AI Studio 的手工复制文本进行清洗并转换为结构化 Markdown
05

部署与配置

  • 克隆仓库:git clone https://github.com/fuadmefleh/Shared-Claude-Chats.git
  • 进入目录:cd Shared-Claude-Chats
  • 建议创建 Python 虚拟环境:python3 -m venv .venv && source .venv/bin/activate
  • 安装依赖:pip install -r requirements.txt
  • 将需要导出的分享链接按平台放入对应 link_lists/*.txt 文件中,或直接使用仓库已有链接列表
  • 运行对应脚本,例如:python3 scripts/claude_share_export.py link_lists/claudeaisharelinks.txt -o claude_chats
  • Grok 示例:python3 scripts/grok_share_export.py link_lists/grokaisharelinks.txt -o grok_chats
  • Kimi 示例:python3 scripts/kimi_share_export.py link_lists/kimiaisharelinks.txt -o kimi_chats
  • Qwen 示例:python3 scripts/qwen_share_export.py link_lists/qwenaisharelinks.txt -o qwen_chats
  • DeepSeek 示例:python3 scripts/deepseek_share_export.py link_lists/deepseeksharelinks.txt -o deepseek_chats
  • 如需重新抓取已归档但可能更新过的对话,可加 --force 参数
06

风险与注意事项

  • 仓库没有明确 license,商用、再分发或训练用途存在版权和合规不确定性
  • 归档内容来自公开分享或手工复制,可能包含个人信息、敏感内容、版权材料或不适合再利用的数据
  • 公开分享链接的 API 和反爬机制可能随平台更新而失效,导出脚本稳定性依赖外部平台
  • Claude 和 Grok 依赖 curl_cffi 绕过 TLS 指纹限制,可能触及平台服务条款边界
  • 数据不是严格清洗后的高质量训练集,可能包含重复、错误、幻觉、偏见或恶意提示内容
  • 仓库中的对话是快照,不是实时同步;原始分享更新后需要 --force 重新抓取
  • Google AI Studio 部分依赖手工复制,容易漏内容或格式不一致
  • 如果用于模型训练或评测,需要额外进行脱敏、去重、版权审查和数据质量评估

历史记录

热榜历史快照

2026-07-30 第7名 新收录 · github_search
2026-07-29 第12名 新收录 · github_search