📖 系统简介
通用数据处理系统是一款功能强大的集合运算和文本处理工具,适用于数据清洗、文本格式化、集合运算等多种场景。系统采用直观的三框操作界面,支持丰富的集合运算和文本处理功能。
注意:除集合操作外的其它大多数功能操作都是针对获得焦点窗口的操作。因此,若对某一个窗口操作时,先在该窗口点击一下使其获得焦点(该文本框背景会变色),然后再执行相关的命令操作。例如,想把B窗口的内容复制到A窗口,先在B窗口中点击一下,然后点击复制命令,接着在A窗口中点击一下,然后点击粘贴命令。
核心特性
- 支持完整的集合运算(差集、并集、交集、对称差、笛卡尔积等)
- 丰富的文本处理功能(大小写转换、前缀后缀添加、正则替换等)
- 数据操作(排序、去重、去空行等)
- 数据统计和分析
- 操作历史记录和撤销功能
- 文件读写支持
🖥️ 界面说明
系统主界面分为三个文本框区域:
📌 文本框 A - 输入集合 A
用于输入或加载第一个数据集。点击文本框可将其设为当前操作对象。
📌 文本框 B - 输入集合 B
用于输入或加载第二个数据集。点击文本框可将其设为当前操作对象。
📌 文本框 C - 结果显示
用于显示集合运算结果,也可作为当前操作对象进行处理。
🔢 集合运算
差集运算 (A - B)
返回在 A 中但不在 B 中的元素。
例子 1:找出 A 独有元素
集合 A
集合 B
结果 (A - B)
例子 2:清理黑名单数据
名单 A
黑名单 B
结果 (A - B)
差集运算 (B - A)
返回在 B 中但不在 A 中的元素。
例子:找出 B 独有元素
集合 A
集合 B
结果 (B - A)
并集运算 (A ∪ B)
返回 A 和 B 中所有不重复的元素。
例子 1:合并两个名单
名单 A
名单 B
结果 (A ∪ B)
例子 2:汇总关键词
关键词 A
关键词 B
结果 (A ∪ B)
交集运算 (A ∩ B)
返回同时在 A 和 B 中的元素。
例子 1:找出共同好友
好友列表 A
好友列表 B
结果 (A ∩ B)
例子 2:找出重复数据
数据 A
数据 B
结果 (A ∩ B)
拼接运算 (A + B)
将 A 和 B 简单拼接,不去重,保留原始顺序。
例子:合并日志文件
日志 A
日志 B
结果 (A + B)
对称差运算
返回在 A 或 B 中,但不同时在两者中的元素。
例子:找出差异项
库存 A
库存 B
结果
笛卡尔积运算
将 A 中每个元素与 B 中每个元素进行组合。
例子 1:生成组合
前缀 A
后缀 B
结果
例子 2:生成测试用例
输入 A
输入 B
结果
✏️ 文本处理
以下操作会应用到当前选中的文本框。
转大写
将所有字母转换为大写。
例子
操作前
操作后
转小写
将所有字母转换为小写。
例子
操作前
操作后
首字母大写
将每行首字母转为大写,其余字母转为小写。
例子
操作前
操作后
添加前缀
在每一行开头添加指定的前缀。
例子:添加编号前缀
操作前
添加前缀 ">> "
例子:添加URL前缀
操作前
添加前缀 "https://example.com/"
添加后缀
在每一行末尾添加指定的后缀。
例子:添加文件扩展名
操作前
添加后缀 ".txt"
例子:添加邮箱后缀
操作前
添加后缀 "@company.com"
移除空白
移除每一行首尾的空格和制表符。
例子
操作前
操作后
反转
将行的顺序颠倒。
例子
操作前
操作后
随机排序
将行的顺序随机打乱。
例子:随机抽奖
参与者
随机排序后
去重保留顺序
移除重复行,保留第一次出现的顺序。
例子
操作前
操作后
提取数字
从文本中提取出纯数字内容。
例子
操作前
操作后
📋 数据操作
排序
按字母顺序排序。第一次点击升序,第二次点击降序。
例子:升序排序
操作前
升序后
例子:降序排序
操作前
降序后
去空行
移除所有空行。
例子
操作前
操作后
去重复
移除重复行(先排序再去重)。
例子
操作前
操作后
交换
交换两个文本框的内容。
例子
操作前 - A
操作前 - B
操作后 - A
操作后 - B
复制到 A
将结果框 C 的内容复制到 A 框。
复制到 B
将结果框 C 的内容复制到 B 框。
📁 文件操作
打开文件 A/B/C
从文件中加载内容到对应文本框。支持 .txt 格式文件。
保存 A/B/C
将文本框内容保存到文件。
保存位置
| 按钮 | 保存位置 | 文件名 |
|---|---|---|
| 保存 A | 程序目录 | a.txt |
| 保存 B | 程序目录 | b.txt |
| 保存 C | 程序目录 | 个人常用信息.txt |
🔧 高级功能
统计
对当前文本框进行详细的数据统计,包括行数、字符数、高频词等。
统计信息包含:
- 总行数
- 有效行数(非空行)
- 去重行数
- 总字符数
- 前10个高频词
例子:统计示例
输入文本
统计结果
加行号
为每一行添加行号。
例子
操作前
操作后
去行号
移除每行开头的行号。
例子
操作前
操作后
正则替换
使用正则表达式进行高级查找和替换。
例子 1:将所有数字替换为星号
操作前
正则模式: \d+
替换为: ****
例子 2:提取邮箱
操作前
正则模式: \w+@\w+\.\w+
替换为: [邮箱已隐藏]
子集判断
判断 A 和 B 两个集合之间的包含关系。
例子 1:A 是 B 的子集
集合 A
集合 B
判断结果
例子 2:A 和 B 相等
集合 A
集合 B
判断结果
过滤
根据条件过滤数据,只保留符合条件的行。
例子:过滤包含特定关键词的行
操作前
过滤关键词: "价格"
⚙️ 其他功能
复制当前
将当前文本框的内容复制到剪贴板。
粘贴当前
将剪贴板内容粘贴到当前文本框。
清空当前
清空当前文本框的内容。
自动换行
切换文本框的自动换行功能。
查找替换
打开查找替换对话框,进行文本查找和替换。
撤销
撤销上一步操作,恢复到之前的状态。
💡 使用技巧
工作流程建议
- 将原始数据加载到 A 框
- 将参考数据加载到 B 框
- 执行集合运算,结果显示在 C 框
- 对 C 框结果进行文本处理和数据清洗
- 保存结果或复制到 A/B 框继续处理
常用操作组合
场景 1:数据清洗流程
- 加载原始数据到 A
- 点击"去空行"
- 点击"移除空白"
- 点击"去重复"
- 点击"排序"
场景 2:对比两个名单
- 加载名单1到 A
- 加载名单2到 B
- 点击"交集"找出共同项
- 点击"A-B"找出 A 独有项
- 点击"B-A"找出 B 独有项
- 使用"子集判断"确认包含关系
场景 3:批量格式化文本
- 加载文本到 A
- 点击"转小写"
- 点击"添加前缀"
- 点击"添加后缀"
- 点击"加行号"