Python · 项目报告

larashero3-dotcom/lieflat-less-ai-tone

一个基于 283 万字语料统计的去 AI 味 skill · An AI-tone removal skill grounded in a 2.83-million-character corpus study

已完成 打开 GitHub
L
309星标
15Fork
0Issue
MIT许可证

分析结果

项目分析

lieflat-less-ai-tone 是一个面向中文文本的“去 AI 味”规则集与研究型 Agent Skill。项目基于约 283 万汉字语料,对 629 篇文章、95,551 个句子、45,721 个段落进行人类写作与模型生成文本对照,筛选出 11 类具有区分度的中文 AI 文风特征,并将其转化为可执行的改写规则。它既可以通过 MoxtHub 使用,也可以用 npx 安装为 skill,或直接把 SKILL.md 作为 system prompt 接入其他支持自定义指令的 AI 工具。

适用领域 中文自然语言处理 / AI 写作辅助 / 文本风格改写 / 生成文本检测与规避 / 语料库语言学 / Agent Skill / Prompt 工程 / 内容生产工具
配置难度 低到中等。普通内容创作者可以直接通过 MoxtHub、npx skill 或复制 SKILL.md 使用,门槛较低;开发者若要将其集成到自有 Agent、写作系统或复算语料指标,需要理解 prompt 编排、Python 脚本运行、语料清洗和文本统计方法,难度为中等。
商业价值 该项目对中文内容生产团队有较高实用价值,能帮助把 AI 初稿处理成更自然、更符合人工写作习惯的文本,降低编辑返工成本。对 AI 写作工具、Agent 平台、内容审核辅助、品牌文案系统和知识库写作流程也有集成价值。其优势在于规则来源有统计依据且可解释,适合包装为企业内部写作规范、AI 润色插件或长文生产工作流的一环。不过商业化时需要注意语料不可完全复核、规则时效性和过度去痕迹带来的合规风险。
01

技术亮点

  • 基于较大规模中文语料统计,而不是只依赖主观经验总结。
  • 明确区分了通过检验和未通过检验的 AI 文风特征,纠正了不少流行误解,例如人类文本中的比喻和设问反而更高频。
  • 提供 11 项可操作改写规则,集中处理对举结构、顿号并列过密、相邻句同构、破折号、冒号滥用、序数词小标题、拟人化喻体、概括覆盖数据、起首语、译文句式、段首零回指评论等问题。
  • 强调信息守恒,不允许为了去 AI 味而新增事实、删除观点或改变判断强度。
  • 规则集可直接作为 Agent Skill 使用,也可作为 prompt 迁移到其他工具,集成成本低。
  • README 公开了测量失误记录和方法局限,研究过程相对透明。
  • MIT 许可证,便于二次开发、内部集成或商业项目使用。
  • 提供脚本支持用户用自有语料复算指标。
02

目标用户

  • 中文内容创作者
  • 公众号、博客、专栏作者
  • 新媒体编辑与运营人员
  • 品牌文案与市场团队
  • 需要润色 AI 初稿的开发者
  • 构建写作 Agent 或内容工作流的 AI 应用开发者
  • 研究中文 AI 文风特征的 NLP 或语言学研究者
  • 使用 Moxt、Claude、ChatGPT、Gemini、Kimi、DeepSeek 等工具进行长文写作的人
03

配置要求

  • 本地安装需要 Node.js 与 npx 环境。
  • 复算脚本需要 Python 3 环境。
  • 复算脚本按目录读取 .md 文件,仓库不包含原始语料,需要用户自行准备语料。
  • 用于对照实验时,人类语料与 AI 语料应尽量在主题、文体、长度和来源上对齐。
  • 如果作为 prompt 使用,需要目标 AI 工具支持 system prompt、自定义指令或类似机制。
  • 如与 writing-dna-skill 配合使用,同目录存在“语言DNA.md”时会优先采用目标作者风格,规则冲突时以风格蒸馏结果为准。
04

适用场景

  • 将大模型生成的中文文章改写得更接近人类写作
  • 在发布前检查并降低文本中的常见 AI 风格痕迹
  • 作为 system prompt 嵌入自定义写作助手或 Agent 工作流
  • 配合 writing-dna-skill 先做目标作者风格逼近,再做 AI 痕迹清理
  • 对自有语料运行脚本,复算 AI 文风特征频率
  • 分析不同模型在中文写作中的风格差异
  • 为内容团队制定可解释、可复核的 AI 文本润色规范
05

部署与配置

  • 方式一:直接访问 MoxtHub 页面使用 lieflat-less-ai-tone skill。
  • 方式二:在本地通过命令安装:npx skills add larashero3-dotcom/lieflat-less-ai-tone。
  • 方式三:不安装工具,直接复制仓库中的 SKILL.md 内容,作为 system prompt 或自定义指令使用。
  • 如需复算研究指标,克隆仓库后准备人类文本目录与 AI 生成文本目录,文本应为 .md 文件。
  • 运行句层特征比较:python3 scripts/compare-human-ai.py --human <人类语料目录...> --ai <AI语料目录...>。
  • 运行段落结构比较:python3 scripts/check-structure.py --human <人类语料目录...> --ai <AI语料目录...>。
  • 运行译文句式频率检查:python3 scripts/check-translationese.py <语料目录...>。
06

风险与注意事项

  • 原始语料因版权与隐私原因未公开,第三方无法完整复核 README 中的统计数值。
  • 规则主要基于正则和形态特征,无法真正理解语义层面的“AI 味”,例如比喻是否贴切、论证是否空泛、案例是否堆砌。
  • 中文写作风格高度依赖作者、题材、平台和时代,统一规则可能误伤某些真实作者的个人风格。
  • 模型迭代很快,当前高区分度特征可能随时间失效。
  • 如果机械套用规则,可能导致文本变得不自然或过度保守。
  • 项目名称和用途可能被用于规避 AI 内容识别,存在合规与伦理争议。
  • 复算结果很依赖语料切分、分母选择和主题文体对齐,非专业用户容易得到误导性结论。
  • 仓库更像研究与规则集,不是完整 SaaS 或开箱即用的图形化应用。

历史记录

热榜历史快照

2026-08-27 第27名 新收录 · github_search