按相似度把长得差不多的行合并掉,解决名单、商品名、地址这类数据"看着重复但字符不完全一样"没法直接去重的麻烦。可以设相似度门槛,比较前选择忽略大小写、空白、标点或数字,重复的一组里保留首次出现或最长的一条。
发布日期: 2026-09-07
描述: 模糊去重,解决名单、商品名看着重复却因字符不同没法直接去重的麻烦。按相似度门槛合并近似行,可忽略大小写、标点、空白,重复组保留首条或最长一条。
使用方法: 1. 把多行文本粘贴到输入框,每行一条;2. 设相似度门槛,数值越高要求越接近才算重复;3. 勾选比较时忽略大小写、标点、空白或数字,选择重复时保留首条还是最长的一条;4. 点「开始去重」查看结果,可切换成重复组对照查看相似度,可复制或下载 txt 文件。
暂无评论,来发表第一条评论吧!