windows - gVim 中的正则表达式从列表中删除重复域

标签 windows regex vim

我需要一个在 gVim 中使用的正则表达式,它将从 URL 列表中删除重复的域(gVim 可以在这里下载:http://www.vim.org/download.php

我在 .txt 文件中有超过 6,000,000 个 URL 的列表(在 gVim 中打开以进行编辑)。

URL 的格式如下:

http://www.example.com/some-url.php
http://example2.com/another_url.html
http://example3.com/
http://www.example4.com/anotherURL.htm
http://www.example.com/some-url2.htm
http://example.com/some-url3.html
http://www.example2.com/somethingelse.php
http://example5.com

换句话说,URL 没有特定的格式。有些有 WWW,有些没有,它们都有不同的格式。

我需要一个为 gVim 编写的正则表达式,它将从列表中删除所有重复的域(及其对应的 URL),留下它找到的第一个实例。

所以它会采用上面发布的示例列表,最终结果应该如下所示:

http://www.example.com/some-url.php
http://example2.com/another_url.html
http://example3.com/
http://www.example4.com/anotherURL.htm
http://example5.com

这里有两个不错的站点,它们很好地解释了如何在 gVim 中使用正则表达式:

http://supportweb.cs.bham.ac.uk/documentation/tutorials/docsystem/build/tutorials/gvim/gvim.html#Vi-Regular-Expressions

http://www.softpanorama.org/Editors/Vimorama/vim_regular_expressions.shtml

最佳答案

如果你想使用正则表达式,你可以尝试调整以下内容:%s!\v%(^http://%(www\.)?(%([^./]+\.)+[^./]+)%(/.*)?$\_.{-})@<=^http://%(www\.)?\1%(/.*)?\n!!g ,但它在 60 亿个 url 上会非常慢,并且由于未知原因而不起作用。这是一个更好的方法:

:let g:gotDomains={}
:%g/^/let curDomain=matchstr(getline('.'), '\v^http://%(www\.)?\zs[^/]+') | if !has_key(g:gotDomains, curDomain) | let g:gotDomains[curDomain]=1 | else | delete _ | endif

它正在做以下事情:

  1. let g:gotDomains={}创建一个空字典,我们将在其中保存所有域
  2. %g/^/{command}执行 {command}在每一行
  3. let curDomain=matchstr(...)获取域名

    1. getline('.')从当前行开始
    2. \v请允许我省略在正则表达式中写很多反斜杠(非常神奇)
    3. ^从字符串开始
    4. \zs从这里开始匹配(省略捕获 \zs 之前的所有内容)
  4. if !has_key(g:gotDomains, curDomain)如果之前没有出现域。

  5. let g:gotDomains[curDomain]=1然后将其添加到已知域列表中(这里不需要 1,我使用字典只是为了更快地访问)。
  6. delete _否则删除到黑洞寄存器的行(这意味着,不要将其内容保存在任何寄存器中)。

关于windows - gVim 中的正则表达式从列表中删除重复域,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/4002115/

相关文章:

vim - 关于vim的youcompleteme快捷键的困惑

vim - 更改 snipMate 中的默认选项卡

windows - 在 Jenkins 中使用 execute shell 命令在 Windows 机器上运行 git 命令

javascript - 使用正则表达式重命名输入

python - 正则表达式数字之间的整个字符串匹配

regex - 正则表达式匹配&lt;title&gt; </title>,包括任意位置的换行符

c++ - 这是管理 COM 初始化的好方法吗?

windows - 自动网页截图

windows - masm32 和 masm 的区别?

fonts - 谁能为 Windows 上的 gVIM 推荐一种更具可读性的默认字体?