python - 文本预处理+Python+CSV : Removing special characters from a column of a CSV

我正在研究文本分类问题。我的 CSV 文件包含一个名为“描述”的列，用于描述事件。不幸的是，该列除了英文单词之外还充满了特殊字符。有时，一行中的整个字段都充满了此类字符，或者，有时，很少有单词具有此类特殊字符，其余的都是英文单词。我向您展示了两个不同行的两个样本字段:

├á┬ñ┬╣├á┬ñ┬░ ├á┬ñ┬╡├á┬ñ┬░├á┬Ñ┬ì├á┬ñ┬╖ ├á┬ñΓÇó├á┬ÑΓé¼ ├á┬ñ┬ñ├á┬ñ┬░├á┬ñ┬╣ ├á┬ñΓÇí├á┬ñ┬╕ ├á┬ñ┬╡├á┬ñ┬░├á┬Ñ┬ì├á┬ñ┬╖ ├á┬ñ┬¡├á┬ÑΓé¼ ├á┬ñ┬╕├á┬ñ┬┐├á┬ñΓÇÜ├á┬ñ┬º├á┬Ñ┬ü ├á┬ñ┬╕├á┬ÑΓÇí├á┬ñ┬¿├á┬ñ┬╛ ├á┬ñ┬ª├á┬Ñ┬ì├á┬ñ┬╡├á┬ñ┬╛├á┬ñ┬░├á┬ñ┬╛ ├á┬ñΓÇá├á┬ñ┬»├á┬ÑΓÇ╣├á┬ñ┼ô├á┬ñ┬┐├á┬ñ┬ñ ├á┬ñ┬╕├á┬ñ┬┐├á┬ñΓÇÜ├á┬ñ┬º├á┬ÑΓé¼ ├á┬ñ┬¬├á┬Ñ┬ì├á┬ñ┬░├á┬ÑΓé¼├á┬ñ┬«├á┬ñ┬┐├á┬ñ┬»├á┬ñ┬░ ├á┬ñ┬▓├á┬ÑΓé¼├á┬ñΓÇö ├á┬ñ┬½├á┬Ñ┬ü├á┬ñ┼╕├á┬ñ┬¼├á┬ÑΓÇ░├á┬ñ┬▓ ├á┬ñ┼╕├á┬ÑΓÇÜ├á┬ñ┬░├á┬Ñ┬ì├á┬ñ┬¿├á┬ñ┬╛├á┬ñ┬«├á┬ÑΓÇí├á┬ñΓÇÜ├á┬ñ┼╕ ├á┬ñΓÇó├á┬ñ┬╛ ├á┬ñΓÇá├á┬ñ┬»├á┬ÑΓÇ╣├á┬ñ┼ô├á┬ñ┬¿ ├á┬ñ┬Å├á┬ñ┬«├á┬ñ┬¼├á┬ÑΓé¼├á┬ñ┬Å├á┬ñ┬« ├á┬ñΓÇö├á┬Ñ┬ì├á┬ñ┬░├á┬ñ┬╛├á┬ñΓÇ░├á┬ñΓÇÜ├á┬ñ┬í ├á┬ñ┬«├á┬ÑΓÇí├á┬ñΓÇÜ ├á┬ñΓÇó├á┬ñ┬░├á┬ñ┬¿├á┬ÑΓÇí ├á┬ñ┼ô├á┬ñ┬╛ ├á┬ñ┬░├á┬ñ┬╣├á┬ÑΓé¼ ├á┬ñ┬╣├á┬Ñ╦å ├á┬ñ┼ô├á┬ñ┬┐├á┬ñ┬╕├á┬ñ┬«├á┬ÑΓÇí├á┬ñΓÇÜ ├á┬ñΓÇª├á┬ñΓÇÜ├á┬ñ┬í├á┬ñ┬░-19 ├á┬ñ┼╕├á┬ÑΓé¼├á┬ñ┬«├á┬ÑΓÇí├á┬ñΓÇÜ ├á┬ñ┬¡├á┬ñ┬╛├á┬ñΓÇö ├á┬ñ┬▓├á┬ÑΓÇí├á┬ñ┬ñ├á┬ÑΓé¼ ├á┬ñ┬╣├á┬Ñ╦å ├á┬ñΓÇá├á┬ñ┬¬ ├á┬ñ┬╕├á┬ñ┬¡├á┬ÑΓé¼ ├á┬ñ┬╕├á┬ÑΓÇí ├á┬ñ┬¿├á┬ñ┬┐├á┬ñ┬╡├á┬ÑΓÇí├á┬ñ┬ª├á┬ñ┬¿ ├á┬ñ┬╣├á┬Ñ╦å ├á┬ñ┬╕├á┬ñ┬«├á┬ñ┬╛├á┬ñ┼ô ├á┬ñΓÇó├á┬ÑΓÇí ├á┬ñ┬»├á┬Ñ┬ü├á┬ñ┬╡├á┬ñ┬╛├á┬ñΓÇ£├á┬ñΓÇÜ ├á┬ñΓÇó├á┬ÑΓÇ╣ ├á┬ñ┬¬├á┬Ñ┬ì├á┬ñ┬░├á┬ÑΓÇ╣├á┬ñ┬ñ├á┬Ñ┬ì├á┬ñ┬╕├á┬ñ┬╛├á┬ñ┬╣├á┬ñ┬¿ ├á┬ñΓÇó├á┬ñ┬░├á┬ñ┬¿├á┬ÑΓÇí ├á┬ñΓÇª├á┬ñ┬╡├á┬ñ┬╢├á┬Ñ┬ì├á┬ñ┬» ├á┬ñ┬¬├á┬ñ┬º├á┬ñ┬╛├á┬ñ┬░├á┬ÑΓÇí├á┬ñΓÇÜ

Unwind on the strums of Guitar &  immerse your soul into the magical vibes of music! ├»┬╕┬Å? ├»┬╕┬Å?..Guitar Night By Ashmik Patil.July 19, 2018.Thursday.9 PM Onwards.*Cover charges applicable...#GuitarNight #MusicalNight #MagicalMusic #MusicLove #Party #Enjoy #TheBarTerminal #Mumbaikars #Mumbai

在第一种情况下，整个字段都充满了此类不可读的字符，而在第二种情况下，只出现了很少的此类字符。其余都是英文单词。

我只想删除那些特殊字符，保持英语单词不变，因为我需要这些英语单词在稍后阶段形成一袋单词。

如何使用 Python 实现这一点(我使用的是 jupyter 笔记本)？

最佳答案

您可以使用regex来做到这一点。假设您已经能够从 CSV 文件中取出文本 -

#python 2.7
import re
text = "Something with special characters á┬ñ┬╡├á┬ñ┬░├á┬Ñ┬ì├á┬ñ┬╖"
cleaned_text = re.sub(r'[^\x00-\x7f]+','', text)
print cleaned_text

Output - Something with special characters

要了解所使用的正则表达式，refer here .

关于python - 文本预处理+Python+CSV : Removing special characters from a column of a CSV，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/52479311/

python - 文本预处理+Python+CSV : Removing special characters from a column of a CSV

上一篇：python - 如何强制Python 3使用单引号输出字符串？

下一篇：python - Pandas 逐个元素地减去两个数据帧的值