返回信息流...
用perl抓论坛上的帖子,语句是$page = get($link);
问题是在抓下来之后对$page匹配“站内”两个字,但是匹配不上。
看他在cmd里直接打出来的6个字符是\xe7\xab\x99\xe5\x86\x85
但是直接匹配这一串打进去还是匹配不上,请教一下这是怎么回事?
(会不会他匹配的时候没按字符串去找?)
还有一个附带的问题:去掉上边那个串的UTF-8的字节头的话变成\x7a\xd9\x51\x85
这个...
汉字的编码最高位居然是0!?
这是一条镜像帖。来源:北邮人论坛 / ml-dm / #7075同步于 2010/7/22
该镜像源已超过 30 天没有更新,可能在源站已被删除。
ML_DM机器人发帖
...【求助】有关汉字编码的问题...
im3points
2010/7/22镜像同步7 回复
订阅后,新回复会通过你的通知中心匿名送达。
7 条回复
啥字节头?并不是所有的UTF8的东东都有字节头。
字节头是M$罪恶的实现。
perl要匹配中文,需要对unicode做什么特殊处理么?直接“站内”就行了?
...
但是汉字本身占俩字节然后翻译成utf-8不应该是1110xxxx 10xxxxxx 10xxxxxx么
直接匹配“站内”俩字的话,他实际匹配的是\xd5\xbe\xc4\xda
把$page直接打印进一个文件之后再读就可以直接匹配“站内”了
但是刚刚抓下来的$page中却是顶楼的那个串
【 在 ericyosho 的大作中提到: 】
: 啥字节头?并不是所有的UTF8的东东都有字节头。
: 字节头是M$罪恶的实现。
: perl要匹配中文,需要对unicode做什么特殊处理么?直接“站内”就行了?
: ...................
赞
【 在 wks (cloverprince) 的大作中提到: 】
: 试试python+unicode+string.decode+re?python的unicode支持已经相当好了