首页 › 开发工具 › 文本按行去重排序工具

文本按行去重排序工具

对多行文本按行去重,支持保留原顺序、升序排序、倒序排列以及标注重复次数四种处理方式,可选择忽略大小写与忽略首尾空格,输出清理后的文本、原行数与去重后行数、删除条数和重复率,并列出出现最多的前 10 行。

处理方式

数据来源:集合去重语义(保留首次出现)与 Unicode 排序(localeCompare zh-CN)

输入总行数10行
有效内容行10行
去重后行数5行
删除的重复行5行
重复率50%
空行数(已忽略)0行
处理方式保留原顺序

出现次数最多的前 10 行

排名内容(原文首次出现的形式)出现次数判定
1订单导出3重复 2 次
2用户反馈2重复 1 次
3API 文档2重复 1 次
4数据分析2重复 1 次
5轻算工具站1唯一
订单导出
用户反馈
API 文档
数据分析
轻算工具站

已忽略每行首尾空格,因此 "ABC" 与 " ABC " 视为同一条。 区分大小写,"Abc" 与 "abc" 算两条。

本页所有计算在浏览器内完成,输入内容不会被上传。

计算口径

判定重复的比较键:可选先去掉首尾空格、再统一转小写;键相同的行归为一条,输出时保留第一次出现的原始写法(不改动大小写与内部空格)。空行不参与去重与统计,避免把排版换行当数据。排序用 localeCompare 的 zh-CN 规则,中文按拼音、英文按字母顺序;标注次数用制表符分隔,可直接粘贴回 Excel 分列。

使用说明

  • 从 Excel 复制一列粘贴进来(每行一条),选"去重保留原顺序"即可保持原有排列
  • 做标签清单时用"去重后按拼音升序",需要新的排前面时用倒序
  • 排查哪些数据重复最多时选"标注重复次数",配合前 10 行统计表定位

常见问题

为什么看起来一样的两行没被去掉?

多半是不可见差异:全角空格、末尾的空格或制表符、大小写不同、可见字符相同但含零宽字符。勾选"忽略首尾空格"和"忽略大小写"能解决前两种,若仍不生效可先用本站的全角半角转换工具清理不可见字符。

排序按什么规则?

中文按拼音(localeCompare 的 zh-CN 折叠规则),英文按字母顺序,数字与符号按 Unicode 码位优先于汉字。注意拼音多音字按常用读音处理,要求严格笔画排序时本工具不适用。

能去掉空行或前后空白以外的重复字符吗?

不能,本工具只做整行级别的去重。行内重复内容(例如一行里重复的词)需要先转成多行再处理,可用"清除多余空白"配合换行分步完成。