0

0

linux下文件中文乱码的一些情况

高洛峰

高洛峰

发布时间:2016-12-15 16:28:49

|

1739人浏览过

|

来源于php中文网

原创

    其实乱码这个问题是由系统集成的字符集引起的,由于不能正确的使用相对应字符的字符集,因此os不能识别出文字导致了乱码,解决的方法不难...... 

    首先,我们先要知道控制linux os 的语言环境变量是 $lang和$lc_all,要解决乱码的情况我们只需要把上述的两个变量正确设置即可. 

乱码分两种情况: 
1.终端(纯shell界面)的乱码 
vi /etc/profile 
export lc_all="zh_cn.gb18030:zh_cn.gb2312:zh_cn.gbk:zh_cn:en_us.utf-8:en_us:en:zh:zh_tw:zh_cn.big5" 
保存退出,reboot系统即可.. 

2.x-window(图形界面)的乱码 
vi /etc/sysconfig/i18n 
lang="zh_cn.gb18030:zh_cn.gb2312:zh_cn.gbk:zh_cn:en_us.utf-8:en_us:en:zh:zh_tw:zh_cn.big5" 
language="zh_cn.gb18030:zh_cn.gb2312:zh_cn.gbk:zh_cn:en_us.utf-8:en_us:en:zh:zh_tw:zh_cn.big5" 
保存reboot即可... 

由于中文的字符集编码很多,我自己也不是十分清楚彼此的兼容性如何,所以就尽可能的找了很多种不同的编码都写了上去,大家也可以自己筛选下,总的解决思路就是修改控制环境参数的变量,增加os所支持的字符集(前提要内核上存在该字符,否则需要编译内核)...


正在开发的web系统是部署在red   head 。 
rh版本信息: 
lsb   version:         :core-3.1-amd64:core-3.1-ia32:core-3.1-noarch:graphics-3.1-amd64:graphics-3.1-ia32:graphics-3.1-noarch 
distributor   id:   redhatenterpriseserver 
description:         red   hat   enterprise   linux   server   release   5   (tikanga) 
release:                 5 
codename:               tikanga 
------------------------------- 
locale   信息 
lang=zh_cn.utf-8 
lc_ctype="zh_cn.utf-8" 
lc_numeric="zh_cn.utf-8" 
lc_time="zh_cn.utf-8" 
lc_collate="zh_cn.utf-8" 
lc_monetary="zh_cn.utf-8" 
lc_messages="zh_cn.utf-8" 
lc_paper="zh_cn.utf-8" 
lc_name="zh_cn.utf-8" 
lc_address="zh_cn.utf-8" 
lc_telephone="zh_cn.utf-8" 
lc_measurement="zh_cn.utf-8" 
lc_identification="zh_cn.utf-8" 
lc_all= 
--------------------------------- 
因为程序目录有若干文件要读出来显示在页面上,文件名为中文名 
我使用file.list()方法得到了文件名列表,可是显示出来的都是乱码。 
new   string(filename.getbytes("utf-8"),"gbk"); 
new   string(filename.getbytes("iso-8859-1"),"gbk"); 
new   string(filename.getbytes(),gbk"); 

都不起作用, 
使用 system.getproperty("file.encoding") 得出的是"utf-8" 
另外,使用   ls   命令查看的时候,是乱码,使用   ls   --show-control-chars   命令就能显示中文名(控制台)




添加 locale, 估计你的系统不支持gbk字符集。

ubuntu下是 vi /var/lib/locales/supported.d/local 

加完后 locale-gen一下, 重新刷新字符集缓存。


如果你需要在linux中操作windows下的文件,那么你可能会经常遇到文件编码转换的问题。windows中默认的文件格式是gbk(gb2312),而linux一般都是utf-8。下面介绍一下,在linux中如何查看文件的编码及如何进行对文件进行编码转换。
一,查看文件编码:
在linux中查看文件编码可以通过以下几种方式:
1.在vim中可以直接查看文件编码
:set fileencoding
即可显示文件编码格式。
如果你只是想查看其它编码格式的文件或者想解决用vim查看文件乱码的问题,那么你可以在
~/.vimrc 文件中添加以下内容:
set encoding=utf-8
fileencodings=ucs-bom,utf-8,cp936
这样,就可以让vim自动识别文件编码(可以自动识别utf-8或者gbk编码的文件),其实就是依照 fileencodings提供的编码列表尝试,如果没有找到合适的编码,就用latin-1(ascii)编码打开。
2. enca (如果你的系统中没有安装这个命令,可以用sudo yum install -y enca 安装 )查看文件编码
$ enca filename
filename: universal transformation format 8 bits; utf-8 
crlf line terminators
需要说明一点的是,enca对某些gbk编码的文件识别的不是很好,识别时会出现:
unrecognized encoding
二,文件编码转换
1.在vim中直接进行转换文件编码,比如将一个文件转换成utf-8格式
:set fileencoding=utf-8
2. iconv 转换,iconv的命令格式如下:
iconv -f encoding -t encoding inputfile
比如将一个utf-8 编码的文件转换成gbk编码
iconv -f gbk -t utf-8 file1 -o file2
3. enconv 转换文件编码
比如要将一个gbk编码的文件转换成utf-8编码,操作如下
enconv -l zh_cn -x utf-8 filename
三,文件名编码转换:
从linux往 windows拷贝文件或者从windows往linux拷贝文件,有时会出现中文文件名乱码的情况,出现这种问题的原因是因为,windows的文件名中文编码默认为gbk,而linux中默认文件名编码为utf8,由于编码不一致,所以导致了文件名乱码的问题,解决这个问题需要对文件名进行转码。
在linux中专门提供了一种工具convmv进行文件名编码的转换,可以将文件名从gbk转换成utf-8编码,或者从utf-8转换到gbk。
首先看一下你的系统上是否安装了convmv,如果没安装的话用:
yum -y install convmv 安装。

下面看一下convmv的具体用法:
convmv -f 源编码 -t 新编码 [选项] 文件名
常用参数:
-r 递归处理子文件夹
–notest 真正进行操作,请注意在默认情况下是不对文件进行真实操作的,而只是试验。
–list 显示所有支持的编码
–unescap 可以做一下转义,比如把%20变成空格

比如我们有一个utf8编码的文件名,转换成gbk编码,命令如下:
convmv -f utf-8 -t gbk –notest utf8编码的文件名
这样转换以后”utf8编码的文件名”会被转换成gbk编码(只是文件名编码的转换,文件内容不会发生变化)


四,vim 编码方式的设置
和所有的流行文本编辑器一样,vim 可以很好的编辑各种字符编码的文件,这当然包括ucs-2、utf-8 等流行的unicode 编码方式。然而不幸的是,和很多来自 linux 世界的软件一样,这需要你自己动手设置。
vim 有四个跟字符编码方式有关的选项,encoding、fileencoding、fileencodings、termencoding (这些选项可能的取值请参考 vim 在线帮助 :help encoding-names),它们的意义如下:
* encoding: vim 内部使用的字符编码方式,包括 vim 的 buffer (缓冲区)、菜单文本、消息文本等。默认是根据你的locale选择.用户手册上建议只在 .vimrc 中改变它的值,事实上似乎也只有在.vimrc 中改变它的值才有意义。你可以用另外一种编码来编辑和保存文件,如你的vim的encoding为utf-8,所编辑的文件采用cp936编码,vim会自动将读入的文件转成utf-8(vim的能读懂的方式),而当你写入文件时,又会自动转回成cp936(文件的保存编码).
* fileencoding: vim 中当前编辑的文件的字符编码方式,vim 保存文件时也会将文件保存为这种字符编码方式 (不管是否新文件都如此)。
* fileencodings: vim自动探测fileencoding的顺序列表,启动时会按照它所列出的字符编码方式逐一探测即将打开的文件的字符编码方式,并且将 fileencoding 设置为最终探测到的字符编码方式。因此最好将unicode 编码方式放到这个列表的最前面,将拉丁语系编码方式 latin1 放到最后面。
* termencoding: vim 所工作的终端 (或者 windows 的 console 窗口) 的字符编码方式。如果vim所在的term与vim编码相同,则无需设置。如其不然,你可以用vim的termencoding选项将自动转换成term 的编码.这个选项在 windows 下对我们常用的 gui 模式的 gvim 无效,而对 console 模式的vim 而言就是 windows 控制台的代码页,并且通常我们不需要改变它。


五,vim 的多字符编码工作方式
1. vim 启动,根据 .vimrc 中设置的 encoding 的值来设置 buffer、菜单文本、消息文的字符编码方式。

2. 读取需要编辑的文件,根据 fileencodings 中列出的字符编码方式逐一探测该文件编码方式。并设置 fileencoding 为探测到的,看起来是正确的 (注1) 字符编码方式。

3. 对比 fileencoding 和 encoding 的值,若不同则调用 iconv 将文件内容转换为encoding 所描述的字符编码方式,并且把转换后的内容放到为此文件开辟的 buffer 里,此时我们就可以开始编辑这个文件了。注意,完成这一步动作需要调用外部的 iconv.dll(注2),你需要保证这个文件存在于 $vimruntime 或者其他列在 path 环境变量中的目录里。

4. 编辑完成后保存文件时,再次对比 fileencoding 和 encoding 的值。若不同,再次调用 iconv 将即将保存的 buffer 中的文本转换为 fileencoding 所描述的字符编码方式,并保存到指定的文件中。同样,这需要调用 iconv.dll由于 unicode 能够包含几乎所有的语言的字符,而且 unicode 的 utf-8 编码方式又是非常具有性价比的编码方式 (空间消耗比 ucs-2 小),因此建议 encoding 的值设置为utf-8。这么做的另一个理由是 encoding 设置为 utf-8 时,vim 自动探测文件的编码方式会更准确 (或许这个理由才是主要的  。我们在中文 windows 里编辑的文件,为了兼顾与其他软件的兼容性,文件编码还是设置为 gb2312/gbk 比较合适,因此 fileencoding 建议设置为 chinese (chinese 是个别名,在 unix 里表示 gb2312,在 windows 里表示cp936,也就是 gbk 的代码页)。

更多linux下文件中文乱码的一些情况相关文章请关注PHP中文网!

名品购物网店系统
名品购物网店系统

适合品牌专卖店专用,从前台的美工设计就开始强调视觉形象,有助于提升商品的档次,打造网店品牌!后台及程序核心比较简洁,着重在线购物,去掉了繁琐的代码及垃圾程式,在结构上更适合一些中高档的时尚品牌商品展示. 率先引入语言包机制,可在1小时内制作出任何语言版本,程序所有应用文字皆引自LANG目录下的语言包文件,独特的套图更换功能,三级物品分类,购物车帖心设计,在国内率先将购物车与商品显示页面完美结合,完

下载

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

通义千问
通义千问

阿里巴巴推出的全能AI助手

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
JavaScript浏览器渲染机制与前端性能优化实践
JavaScript浏览器渲染机制与前端性能优化实践

本专题围绕 JavaScript 在浏览器中的执行与渲染机制展开,系统讲解 DOM 构建、CSSOM 解析、重排与重绘原理,以及关键渲染路径优化方法。内容涵盖事件循环机制、异步任务调度、资源加载优化、代码拆分与懒加载等性能优化策略。通过真实前端项目案例,帮助开发者理解浏览器底层工作原理,并掌握提升网页加载速度与交互体验的实用技巧。

1

2026.03.06

Rust内存安全机制与所有权模型深度实践
Rust内存安全机制与所有权模型深度实践

本专题围绕 Rust 语言核心特性展开,深入讲解所有权机制、借用规则、生命周期管理以及智能指针等关键概念。通过系统级开发案例,分析内存安全保障原理与零成本抽象优势,并结合并发场景讲解 Send 与 Sync 特性实现机制。帮助开发者真正理解 Rust 的设计哲学,掌握在高性能与安全性并重场景中的工程实践能力。

21

2026.03.05

PHP高性能API设计与Laravel服务架构实践
PHP高性能API设计与Laravel服务架构实践

本专题围绕 PHP 在现代 Web 后端开发中的高性能实践展开,重点讲解基于 Laravel 框架构建可扩展 API 服务的核心方法。内容涵盖路由与中间件机制、服务容器与依赖注入、接口版本管理、缓存策略设计以及队列异步处理方案。同时结合高并发场景,深入分析性能瓶颈定位与优化思路,帮助开发者构建稳定、高效、易维护的 PHP 后端服务体系。

106

2026.03.04

AI安装教程大全
AI安装教程大全

2026最全AI工具安装教程专题:包含各版本AI绘图、AI视频、智能办公软件的本地化部署手册。全篇零基础友好,附带最新模型下载地址、一键安装脚本及常见报错修复方案。每日更新,收藏这一篇就够了,让AI安装不再报错!

50

2026.03.04

Swift iOS架构设计与MVVM模式实战
Swift iOS架构设计与MVVM模式实战

本专题聚焦 Swift 在 iOS 应用架构设计中的实践,系统讲解 MVVM 模式的核心思想、数据绑定机制、模块拆分策略以及组件化开发方法。内容涵盖网络层封装、状态管理、依赖注入与性能优化技巧。通过完整项目案例,帮助开发者构建结构清晰、可维护性强的 iOS 应用架构体系。

87

2026.03.03

C++高性能网络编程与Reactor模型实践
C++高性能网络编程与Reactor模型实践

本专题围绕 C++ 在高性能网络服务开发中的应用展开,深入讲解 Socket 编程、多路复用机制、Reactor 模型设计原理以及线程池协作策略。内容涵盖 epoll 实现机制、内存管理优化、连接管理策略与高并发场景下的性能调优方法。通过构建高并发网络服务器实战案例,帮助开发者掌握 C++ 在底层系统与网络通信领域的核心技术。

27

2026.03.03

Golang 测试体系与代码质量保障:工程级可靠性建设
Golang 测试体系与代码质量保障:工程级可靠性建设

Go语言测试体系与代码质量保障聚焦于构建工程级可靠性系统。本专题深入解析Go的测试工具链(如go test)、单元测试、集成测试及端到端测试实践,结合代码覆盖率分析、静态代码扫描(如go vet)和动态分析工具,建立全链路质量监控机制。通过自动化测试框架、持续集成(CI)流水线配置及代码审查规范,实现测试用例管理、缺陷追踪与质量门禁控制,确保代码健壮性与可维护性,为高可靠性工程系统提供质量保障。

79

2026.02.28

Golang 工程化架构设计:可维护与可演进系统构建
Golang 工程化架构设计:可维护与可演进系统构建

Go语言工程化架构设计专注于构建高可维护性、可演进的企业级系统。本专题深入探讨Go项目的目录结构设计、模块划分、依赖管理等核心架构原则,涵盖微服务架构、领域驱动设计(DDD)在Go中的实践应用。通过实战案例解析接口抽象、错误处理、配置管理、日志监控等关键工程化技术,帮助开发者掌握构建稳定、可扩展Go应用的最佳实践方法。

61

2026.02.28

Golang 性能分析与运行时机制:构建高性能程序
Golang 性能分析与运行时机制:构建高性能程序

Go语言以其高效的并发模型和优异的性能表现广泛应用于高并发、高性能场景。其运行时机制包括 Goroutine 调度、内存管理、垃圾回收等方面,深入理解这些机制有助于编写更高效稳定的程序。本专题将系统讲解 Golang 的性能分析工具使用、常见性能瓶颈定位及优化策略,并结合实际案例剖析 Go 程序的运行时行为,帮助开发者掌握构建高性能应用的关键技能。

50

2026.02.28

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
PHP基础入门课程
PHP基础入门课程

共33课时 | 2.2万人学习

Laravel基础快速入门
Laravel基础快速入门

共15课时 | 1.8万人学习

通用后台管理系统开发(Laravel)
通用后台管理系统开发(Laravel)

共21课时 | 4.2万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号