Python 数据抓取

我想从 http://www.youtube-mp3.org/ 下载几首歌曲.我正在使用 urllib2 和 BeautifulSoup .

问题是，当我使用插入了视频 ID 的 urllib2 打开网站时，http://www.youtube-mp3.org/?c#v=lV7r8PiuecQ ，我得到了该网站，但他们对此很棘手，并在初始页面加载后使用一些 js ajax 内容加载信息。因此，当我尝试抓取下载链接的 url 时，实际上不在页面上，因为它尚未加载。

任何人都知道我怎样才能在我的 python 脚本中触发这个 js 加载器，或者什么？

这是我想要的内容加载到其中之前的相关空 html。

<div id="link_box" style="display:none">
   <div id="link_box_title" style="font-weight:bold; text-decoration:underline">
   </div>
   <div class="row">
    <div id="link_box_bb_code_title" style="font-weight:bold">
    </div>
    <input type="text" id="BBCodeLink" onclick="sAll(this)" />
   </div>
   <div class="row">
    <div id="link_box_html_code_title" style="font-weight:bold">
    </div>
    <input type="text" id="HTMLLink" onclick="sAll(this)" />
   </div>
   <div class="row">
    <div id="link_box_direct_code_title" style="font-weight:bold">
    </div>
    <input type="text" id="DirectLink" onclick="sAll(this)" />
   </div>
  </div>
  <div id="v-ads">
  </div>
  <div id="dl_link">
  </div>
  <div id="progress">
  </div>
  <div id="loader">
   <img src="ajax-loader-b.gif" alt="loading.." width="16" height="11" />
  </div>
 </div>
 <div class="clear">
 </div>
</div>

最佳答案

API 是基于 JSON 的，因此 html 文件的内容不会让您知道在哪里可以找到这些文件。探索此类 Web 服务时，一个好主意是打开 Chrome 开发人员工具中的“网络”选项卡，然后查看它在与页面交互时加载了哪些页面。该练习向我展示了两个特别有趣的 url:

第一个 url 似乎正在排队等待处理的文件，第二个 url 用于获取处理作业的状态。

第二个 url 采用 video_id GET 参数，它是 youtube (http://www.youtube.com/watch?v=KMU0tzLwhbE) 上视频的 ID，并返回解码作业的状态。第二个和第三个似乎与此目的无关，您可以通过使用和不使用额外参数测试加载 url 来验证。

页面内容为:

info = { "title" : "Developers", 
         "image" : "http://i4.ytimg.com/vi/KMU0tzLwhbE/default.jpg", 
         "length" : "3", "status" : "serving", "progress_speed" : "", 
         "progress" : "", "ads" : "", 
         "h" : "a0aa17294103c638fa7f5e0606f839d3" };

恰好是 JSON 数据。其中有趣的一点是“a0aa17294103c638fa7f5e0606f839d3”，它看起来像网络服务用来引用解码的 mp3 文件的哈希。还要检查首页上的下载链接的外观:

http://www.youtube-mp3.org/get?video_id=KMU0tzLwhbE&h=a0aa17294103c638fa7f5e0606f839d3

现在我们已经拼凑了所有缺失的拼图。首先，我们获取 youtube 视频的 url (http://www.youtube.com/watch?v=iKP7DZmqdbU) url 引用它并使用此 url 将其提供给 api:

http://www.youtube-mp3.org/api/pushItem/?item=http%3A//www.youtube.com/watch%3Fv%3DiKP7DZmqdbU&xy=trve

然后，稍等片刻，直到解码工作完成:

http://www.youtube-mp3.org/api/itemInfo/?video_id=iKP7DZmqdbU

将在信息 url 中找到的哈希值构造下载 url:

http://www.youtube-mp3.org/get?video_id=iKP7DZmqdbU&h=2e4b61b6ddc8bf83f5a0e4e4ee0635bb

请注意，网站站长可能不想被抓取，如果人们开始(在网站站长眼中)滥用网站，他们会采取反制措施。例如它似乎使用了 referer 保护，所以点击这篇文章中的链接将不起作用，您必须复制它们并在新的浏览器窗口中加载它们。

测试代码:

from re import findall
from time import sleep
from urllib import urlopen, quote

yt_code = 'gijypDkEqUA'

yt_url = 'http://www.youtube.com/watch?v=%s' % yt_code
push_url_fmt = 'http://www.youtube-mp3.org/api/pushItem/?item=%s&xy=trve'
info_url_fmt = 'http://www.youtube-mp3.org/api/itemInfo/?video_id=%s'
download_url_fmt = 'http://www.youtube-mp3.org/get?video_id=%s&h=%s'
push_url = push_url_fmt % quote(yt_url)
data = urlopen(push_url).read()
sleep(10)
info_url = info_url_fmt % yt_code
data = urlopen(info_url).read()
res = findall('"h" : "([^"]*)"', data)
download_url = download_url_fmt % (yt_code, res[0])
print 'Download here:', download_url

关于Python 数据抓取，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/7240382/

上一篇：python - 在私有(private)类前加上下划线是约定俗成的吗？

下一篇：可变元组长度的python字符串格式