python – проблемы с регулярным выражением и unicode

Привет, У меня проблема в python. Я пытаюсь объяснить свою проблему на примере.

У меня есть эта строка:

>>> string = 'ÐÑÒÓÔÕÖ×ØÙÚÛÜÝÞßàáâãäåæçèéêëìíîïðñòóôõö÷øùúûüýþÿÀÁÂÃ' >>> print string ÐÑÒÓÔÕÖ×ØÙÚÛÜÝÞßàáâãäåæçèéêëìíîïðñòóôõö÷øùúûüýþÿÀÁÂà 

и я хочу, например, заменить charachters, отличные от Ñ, Ã, ï с ""

я пытался:

 >>> rePat = re.compile('[^ÑÃï]',re.UNICODE) >>> print rePat.sub("",string)  Ñ                             ï                   Ã 

Я получил это . Я думаю, что это происходит потому, что этот тип символов в python представлен двумя позициями в векторе: например, \ xc3 \ x91 = Ñ. Для этого, когда я делаю реголярное выражение, все \ xc3 не замещаются. Как я могу сделать этот тип sub ?????

Спасибо Франко

Вы должны убедиться, что ваши строки являются строками unicode, а не строковыми строками (простые строки похожи на массивы байтов).

Пример:

 >>> string = 'ÐÑÒÓÔÕÖ×ØÙÚÛÜÝÞßàáâãäåæçèéêëìíîïðñòóôõö÷øùúûüýþÿÀÁÂÃ' >>> type(string) <type 'str'> # do this instead: # (note the u in front of the ', this marks the character sequence as a unicode literal) >>> string = u'\xd0\xd1\xd2\xd3\xd4\xd5\xd6\xd7\xd8\xd9\xda\xdb\xdc\xdd\xde\xdf\xe0\xe1\xe2\xe3\xe4\xe5\xe6\xe7\xe8\xe9\xea\xeb\xec\xed\xee\xef\xf0\xf1\xf2\xf3\xf4\xf5\xf6\xf7\xf8\xf9\xfa\xfb\xfc\xfd\xfe\xff\xc0\xc1\xc2\xc3' # or: >>> string = 'ÐÑÒÓÔÕÖ×ØÙÚÛÜÝÞßàáâãäåæçèéêëìíîïðñòóôõö÷øùúûüýþÿÀÁÂÃ'.decode('utf-8') # ... but be aware that the latter will only work if the terminal (or source file) has utf-8 encoding # ... it is a best practice to use the \xNN form in unicode literals, as in the first example >>> type(string) <type 'unicode'> >>> print string ÐÑÒÓÔÕÖ×ØÙÚÛÜÝÞßàáâãäåæçèéêëìíîïðñòóôõö÷øùúûüýþÿÀÁÂà >>> rePat = re.compile(u'[^\xc3\x91\xc3\x83\xc3\xaf]',re.UNICODE) >>> print rePat.sub("", string) à 

При чтении из файла string = open('filename.txt').read() читает последовательность байтов.

Чтобы получить содержимое юникода, выполните: string = unicode(open('filename.txt').read(), 'encoding') . Или: string = open('filename.txt').read().decode('encoding') .

Модуль кодеков может мгновенно декодировать потоки Unicode (например, файлы).

Сделайте поиск google для юникода python . Управлять юникодом Python можно немного усердно понять, он платит, чтобы прочитать его.

Я живу по этому правилу: «Программное обеспечение должно работать только со строками Unicode внутри, конвертируя его в конкретную кодировку на выходе». (от http://www.amk.ca/python/howto/unicode )

Я также рекомендую: http://www.joelonsoftware.com/articles/Unicode.html