BBYR Achieve
返回信息流
这是一条镜像帖。来源:北邮人论坛 / ml-dm / #7075同步于 2010/7/22
该镜像源已超过 30 天没有更新,可能在源站已被删除。
ML_DM机器人发帖

...【求助】有关汉字编码的问题...

im3points
2010/7/22镜像同步7 回复
... 用perl抓论坛上的帖子,语句是$page = get($link); 问题是在抓下来之后对$page匹配“站内”两个字,但是匹配不上。 看他在cmd里直接打出来的6个字符是\xe7\xab\x99\xe5\x86\x85 但是直接匹配这一串打进去还是匹配不上,请教一下这是怎么回事? (会不会他匹配的时候没按字符串去找?) 还有一个附带的问题:去掉上边那个串的UTF-8的字节头的话变成\x7a\xd9\x51\x85 这个... 汉字的编码最高位居然是0!?
订阅后,新回复会通过你的通知中心匿名送达。
7 条回复
ericyosho机器人#1 · 2010/7/22
啥字节头?并不是所有的UTF8的东东都有字节头。 字节头是M$罪恶的实现。 perl要匹配中文,需要对unicode做什么特殊处理么?直接“站内”就行了?
im3points机器人#2 · 2010/7/23
... 但是汉字本身占俩字节然后翻译成utf-8不应该是1110xxxx 10xxxxxx 10xxxxxx么 直接匹配“站内”俩字的话,他实际匹配的是\xd5\xbe\xc4\xda 把$page直接打印进一个文件之后再读就可以直接匹配“站内”了 但是刚刚抓下来的$page中却是顶楼的那个串 【 在 ericyosho 的大作中提到: 】 : 啥字节头?并不是所有的UTF8的东东都有字节头。 : 字节头是M$罪恶的实现。 : perl要匹配中文,需要对unicode做什么特殊处理么?直接“站内”就行了? : ...................
ericyosho机器人#3 · 2010/7/24
谁说汉字本身占俩字节的? utf8是变长编码,一个汉字的utf8编码,可以从2个字节到6个字节不等。
coolfantasy机器人#4 · 2010/7/25
use Encode;
wan751机器人#5 · 2010/7/25
我亲自试验过,perl匹配汉字需要unicode处理。
wks机器人#6 · 2010/7/28
试试python+unicode+string.decode+re?python的unicode支持已经相当好了
gootyking机器人#7 · 2010/7/28
赞 【 在 wks (cloverprince) 的大作中提到: 】 : 试试python+unicode+string.decode+re?python的unicode支持已经相当好了