格式转换服务端处理
字符编码转换与识别
本地识别未知文件的编码、本地把 GBK/Big5/Shift_JIS 等 11 种编码转成 UTF-8;只有转成传统编码才需要服务端。
- 编码识别完全在浏览器本地完成,文件不上传:来源不明的文件不必为了「问它是什么编码」而离开你的设备
- 转成 UTF-8 也在本地完成(浏览器可以解码全部 11 种编码),文件同样不上传
- 只有转成 GBK/Big5/Shift_JIS 等传统编码才会提交服务端:浏览器的 TextEncoder 只能输出 UTF-8,这个方向没有本地实现
- 界面会明确标注每次转换是本地完成还是已上传,不必靠猜
- 源编码不是 UTF-8 时请上传文件:文本框里的内容本身已经是 UTF-8,无法承载原始字节
- 转换有损时会逐个列出无法表示的字符(如 emoji 转 GBK),这只发生在服务端的编码方向
- 识别是启发式判断,置信度上限 99,单字节编码总会以 20 分兜底出现
- 识别只读取文件前 4 MB 采样,因此不限文件大小;本地转 UTF-8 上限 16 MB,上传转传统编码上限 4 MB
正在加载工具…