<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0">
<channel>
<title>华蛛社区 - 最新问题</title>
<link>http://spider.site-digger.com/questions</link>
<description>Powered by Question2Answer</description>
<item>
<title>selenium框架的webdriver 被识别出来了，如何破之？</title>
<link>http://spider.site-digger.com/52/selenium%E6%A1%86%E6%9E%B6%E7%9A%84webdriver-%E8%A2%AB%E8%AF%86%E5%88%AB%E5%87%BA%E6%9D%A5%E4%BA%86%EF%BC%8C%E5%A6%82%E4%BD%95%E7%A0%B4%E4%B9%8B%EF%BC%9F</link>
<description>用webdrvier解决滑动验证码的问题，结果被对方检测出来是selenium框架，滑完之后没有反应，怎么办，在线等&lt;br /&gt;
&lt;br /&gt;
&amp;nbsp;&lt;br /&gt;
&lt;br /&gt;
目标网站 ：e.dianping.com</description>
<category>技术交流</category>
<guid isPermaLink="true">http://spider.site-digger.com/52/selenium%E6%A1%86%E6%9E%B6%E7%9A%84webdriver-%E8%A2%AB%E8%AF%86%E5%88%AB%E5%87%BA%E6%9D%A5%E4%BA%86%EF%BC%8C%E5%A6%82%E4%BD%95%E7%A0%B4%E4%B9%8B%EF%BC%9F</guid>
<pubDate>Wed, 29 Aug 2018 08:20:13 +0000</pubDate>
</item>
<item>
<title>关于浏览器 模拟手机访问H5页面，无法定位怎么办？</title>
<link>http://spider.site-digger.com/51/%E5%85%B3%E4%BA%8E%E6%B5%8F%E8%A7%88%E5%99%A8-%E6%A8%A1%E6%8B%9F%E6%89%8B%E6%9C%BA%E8%AE%BF%E9%97%AEh5%E9%A1%B5%E9%9D%A2%EF%BC%8C%E6%97%A0%E6%B3%95%E5%AE%9A%E4%BD%8D%E6%80%8E%E4%B9%88%E5%8A%9E%EF%BC%9F</link>
<description>&lt;p&gt;
	&amp;nbsp;&amp;nbsp;&lt;img alt=&quot;&quot; src=&quot;http://spider.site-digger.com/?qa=blob&amp;amp;qa_blobid=7391188140334817240&quot; style=&quot;width: 810px; height: 761px;&quot;&gt;&lt;/p&gt;</description>
<category>技术交流</category>
<guid isPermaLink="true">http://spider.site-digger.com/51/%E5%85%B3%E4%BA%8E%E6%B5%8F%E8%A7%88%E5%99%A8-%E6%A8%A1%E6%8B%9F%E6%89%8B%E6%9C%BA%E8%AE%BF%E9%97%AEh5%E9%A1%B5%E9%9D%A2%EF%BC%8C%E6%97%A0%E6%B3%95%E5%AE%9A%E4%BD%8D%E6%80%8E%E4%B9%88%E5%8A%9E%EF%BC%9F</guid>
<pubDate>Wed, 08 Aug 2018 03:27:47 +0000</pubDate>
</item>
<item>
<title>如何抓取微信小程序的数据？</title>
<link>http://spider.site-digger.com/50/%E5%A6%82%E4%BD%95%E6%8A%93%E5%8F%96%E5%BE%AE%E4%BF%A1%E5%B0%8F%E7%A8%8B%E5%BA%8F%E7%9A%84%E6%95%B0%E6%8D%AE%EF%BC%9F</link>
<description>安卓手机怎样设置代理</description>
<category>技术交流</category>
<guid isPermaLink="true">http://spider.site-digger.com/50/%E5%A6%82%E4%BD%95%E6%8A%93%E5%8F%96%E5%BE%AE%E4%BF%A1%E5%B0%8F%E7%A8%8B%E5%BA%8F%E7%9A%84%E6%95%B0%E6%8D%AE%EF%BC%9F</guid>
<pubDate>Thu, 12 Jul 2018 05:03:38 +0000</pubDate>
</item>
<item>
<title>selenium+phantomjs方式下载页面，如何设置账号密码验证？</title>
<link>http://spider.site-digger.com/46/selenium-phantomjs%E6%96%B9%E5%BC%8F%E4%B8%8B%E8%BD%BD%E9%A1%B5%E9%9D%A2%EF%BC%8C%E5%A6%82%E4%BD%95%E8%AE%BE%E7%BD%AE%E8%B4%A6%E5%8F%B7%E5%AF%86%E7%A0%81%E9%AA%8C%E8%AF%81%EF%BC%9F</link>
<description>&lt;p&gt;
	&lt;strong&gt;selenium+phantomjs方式下载页面，如何设置账号密码验证？&lt;/strong&gt;&lt;/p&gt;
&lt;pre style=&quot;color: rgb(0, 0, 0); font-family: Menlo; font-size: 9pt;&quot;&gt;
Java代码如下：（账号密码不知道怎么设置）
Proxy proxy = &lt;span style=&quot;color:#000080;font-weight:bold;&quot;&gt;new &lt;/span&gt;Proxy();
        proxy.setHttpProxy(ipport)
                .setFtpProxy(ipport)
                .setSslProxy(ipport);
        proxy.setProxyType(Proxy.ProxyType.&lt;span style=&quot;color:#660e7a;font-weight:bold;font-style:italic;&quot;&gt;MANUAL&lt;/span&gt;);&lt;span style=&quot;color:#808080;font-style:italic;&quot;&gt;
&lt;/span&gt;&lt;span style=&quot;color:#808080;font-style:italic;&quot;&gt;        &lt;/span&gt;proxy.setNoProxy(&lt;span style=&quot;color:#008000;font-weight:bold;&quot;&gt;&quot;localhost&quot;&lt;/span&gt;);
&lt;span style=&quot;color:#808080;font-style:italic;&quot;&gt;//        sCaps.setCapability(CapabilityType.ForSeleniumServer.AVOIDING_PROXY, true);
&lt;/span&gt;&lt;span style=&quot;color:#808080;font-style:italic;&quot;&gt;//        sCaps.setCapability(CapabilityType.ForSeleniumServer.ONLY_PROXYING_SELENIUM_TRAFFIC, true);&lt;/span&gt;&lt;span style=&quot;color:#808080;font-style:italic;&quot;&gt;
&lt;/span&gt;&lt;span style=&quot;color:#808080;font-style:italic;&quot;&gt;        &lt;/span&gt;&lt;span style=&quot;color:#660e7a;font-style:italic;&quot;&gt;sCaps&lt;/span&gt;.setCapability(CapabilityType.&lt;span style=&quot;color:#660e7a;font-weight:bold;font-style:italic;&quot;&gt;PROXY&lt;/span&gt;, proxy);&lt;/pre&gt;</description>
<category>技术交流</category>
<guid isPermaLink="true">http://spider.site-digger.com/46/selenium-phantomjs%E6%96%B9%E5%BC%8F%E4%B8%8B%E8%BD%BD%E9%A1%B5%E9%9D%A2%EF%BC%8C%E5%A6%82%E4%BD%95%E8%AE%BE%E7%BD%AE%E8%B4%A6%E5%8F%B7%E5%AF%86%E7%A0%81%E9%AA%8C%E8%AF%81%EF%BC%9F</guid>
<pubDate>Tue, 26 Jun 2018 07:29:44 +0000</pubDate>
</item>
<item>
<title>squid 如何代理多个adsl拨号的IP</title>
<link>http://spider.site-digger.com/44/squid-%E5%A6%82%E4%BD%95%E4%BB%A3%E7%90%86%E5%A4%9A%E4%B8%AAadsl%E6%8B%A8%E5%8F%B7%E7%9A%84ip</link>
<description>squid 如何代理多个adsl拨号的IP？因为IP是拨号的不固定 ，</description>
<category>技术交流</category>
<guid isPermaLink="true">http://spider.site-digger.com/44/squid-%E5%A6%82%E4%BD%95%E4%BB%A3%E7%90%86%E5%A4%9A%E4%B8%AAadsl%E6%8B%A8%E5%8F%B7%E7%9A%84ip</guid>
<pubDate>Fri, 08 Dec 2017 07:24:40 +0000</pubDate>
</item>
<item>
<title>Squid配置高匿代理 但无法隐藏X-Cache和X-Xache-Lookup</title>
<link>http://spider.site-digger.com/42/squid%E9%85%8D%E7%BD%AE%E9%AB%98%E5%8C%BF%E4%BB%A3%E7%90%86-%E4%BD%86%E6%97%A0%E6%B3%95%E9%9A%90%E8%97%8Fx-cache%E5%92%8Cx-xache-lookup</link>
<description>&lt;p&gt;
	我按照高匿代理配置如下:&lt;/p&gt;
&lt;div&gt;
	request_header_access Via deny all&lt;/div&gt;
&lt;div&gt;
	request_header_access X-Forwarded-For deny all&lt;/div&gt;
&lt;div&gt;
	request_header_access Forwarded deny all&lt;/div&gt;
&lt;div&gt;
	request_header_access Proxy-Connection deny all&lt;/div&gt;
&lt;div&gt;
	request_header_access X-Cache deny all&lt;/div&gt;
&lt;div&gt;
	request_header_access X-Cache-Lookup deny all&lt;/div&gt;
&lt;div&gt;
	&amp;nbsp;&lt;/div&gt;
&lt;div&gt;
	reply_header_access Via deny all&lt;/div&gt;
&lt;div&gt;
	reply_header_access X-Cache deny all&lt;/div&gt;
&lt;div&gt;
	reply_header_access X-Cache-Lookup deny all&lt;/div&gt;
&lt;div&gt;
	reply_header_access Proxy-Connection deny all&lt;/div&gt;
&lt;div&gt;
	但是使用curl命令进行分析发现头部信息依旧包含X-Cache和X-Xache-Lookup信息还有via信息，返回信息如下：&lt;/div&gt;
&lt;div&gt;
	&lt;div&gt;
		$ sudo curl -I -x localhost:6666 http://httpbin.org/ip&lt;/div&gt;
	&lt;div&gt;
		HTTP/1.1 200 OK&lt;/div&gt;
	&lt;div&gt;
		Server: meinheld/0.6.1&lt;/div&gt;
	&lt;div&gt;
		Date: Wed, 29 Nov 2017 03:08:10 GMT&lt;/div&gt;
	&lt;div&gt;
		Content-Type: application/json&lt;/div&gt;
	&lt;div&gt;
		Access-Control-Allow-Origin: *&lt;/div&gt;
	&lt;div&gt;
		Access-Control-Allow-Credentials: true&lt;/div&gt;
	&lt;div&gt;
		X-Powered-By: Flask&lt;/div&gt;
	&lt;div&gt;
		X-Processed-Time: 0.000948905944824&lt;/div&gt;
	&lt;div&gt;
		Content-Length: 33&lt;/div&gt;
	&lt;div&gt;
		&lt;span style=&quot;color:#ff0000;&quot;&gt;Via: 1.1 vegur&lt;/span&gt;&lt;/div&gt;
	&lt;div&gt;
		&lt;span style=&quot;color:#ff0000;&quot;&gt;X-Cache: MISS from szpilman-OptiPlex-3010&lt;/span&gt;&lt;/div&gt;
	&lt;div&gt;
		&lt;span style=&quot;color:#ff0000;&quot;&gt;X-Cache-Lookup: MISS from szpilman-OptiPlex-3010:6666&lt;/span&gt;&lt;/div&gt;
	&lt;div&gt;
		&lt;span style=&quot;color:#ff0000;&quot;&gt;Connection: keep-alive&lt;/span&gt;&lt;/div&gt;
	&lt;div&gt;
		没有起到高匿的效果啊。请问我的配置哪里出了问题，能够详细说明一下么？&lt;/div&gt;
	&lt;div&gt;
		Connection参数是否被知晓是爬虫？？？？？&lt;/div&gt;
	&lt;div&gt;
		Ubuntu版本：16.04&lt;/div&gt;
	&lt;div&gt;
		squid：3.5&lt;/div&gt;
&lt;/div&gt;
&lt;p&gt;
	&amp;nbsp;&lt;/p&gt;</description>
<category>技术交流</category>
<guid isPermaLink="true">http://spider.site-digger.com/42/squid%E9%85%8D%E7%BD%AE%E9%AB%98%E5%8C%BF%E4%BB%A3%E7%90%86-%E4%BD%86%E6%97%A0%E6%B3%95%E9%9A%90%E8%97%8Fx-cache%E5%92%8Cx-xache-lookup</guid>
<pubDate>Wed, 29 Nov 2017 03:12:00 +0000</pubDate>
</item>
<item>
<title>如何用Python爬取裁判文书网上的案例</title>
<link>http://spider.site-digger.com/40/%E5%A6%82%E4%BD%95%E7%94%A8python%E7%88%AC%E5%8F%96%E8%A3%81%E5%88%A4%E6%96%87%E4%B9%A6%E7%BD%91%E4%B8%8A%E7%9A%84%E6%A1%88%E4%BE%8B</link>
<description></description>
<category>技术交流</category>
<guid isPermaLink="true">http://spider.site-digger.com/40/%E5%A6%82%E4%BD%95%E7%94%A8python%E7%88%AC%E5%8F%96%E8%A3%81%E5%88%A4%E6%96%87%E4%B9%A6%E7%BD%91%E4%B8%8A%E7%9A%84%E6%A1%88%E4%BE%8B</guid>
<pubDate>Tue, 21 Nov 2017 13:29:13 +0000</pubDate>
</item>
<item>
<title>如何获取大众点评的某个行业的商家信息？</title>
<link>http://spider.site-digger.com/38/%E5%A6%82%E4%BD%95%E8%8E%B7%E5%8F%96%E5%A4%A7%E4%BC%97%E7%82%B9%E8%AF%84%E7%9A%84%E6%9F%90%E4%B8%AA%E8%A1%8C%E4%B8%9A%E7%9A%84%E5%95%86%E5%AE%B6%E4%BF%A1%E6%81%AF%EF%BC%9F</link>
<description>我想整理学校周边的便利店商家信息，一个个在大众点评上录入太慢了，怎么快速的提取出来？感谢!</description>
<category>技术交流</category>
<guid isPermaLink="true">http://spider.site-digger.com/38/%E5%A6%82%E4%BD%95%E8%8E%B7%E5%8F%96%E5%A4%A7%E4%BC%97%E7%82%B9%E8%AF%84%E7%9A%84%E6%9F%90%E4%B8%AA%E8%A1%8C%E4%B8%9A%E7%9A%84%E5%95%86%E5%AE%B6%E4%BF%A1%E6%81%AF%EF%BC%9F</guid>
<pubDate>Wed, 10 May 2017 03:36:39 +0000</pubDate>
</item>
<item>
<title>抓取微信小程序摩单车的数据</title>
<link>http://spider.site-digger.com/36/%E6%8A%93%E5%8F%96%E5%BE%AE%E4%BF%A1%E5%B0%8F%E7%A8%8B%E5%BA%8F%E6%91%A9%E5%8D%95%E8%BD%A6%E7%9A%84%E6%95%B0%E6%8D%AE</link>
<description>安卓平台，微信小程序摩拜单车的数据爬取&lt;br /&gt;
&lt;br /&gt;
也用python在安卓机上运行爬虫程序吗？</description>
<category>技术交流</category>
<guid isPermaLink="true">http://spider.site-digger.com/36/%E6%8A%93%E5%8F%96%E5%BE%AE%E4%BF%A1%E5%B0%8F%E7%A8%8B%E5%BA%8F%E6%91%A9%E5%8D%95%E8%BD%A6%E7%9A%84%E6%95%B0%E6%8D%AE</guid>
<pubDate>Sun, 23 Apr 2017 01:12:45 +0000</pubDate>
</item>
<item>
<title>如何把 Java爬虫程序 封装成安装程序？</title>
<link>http://spider.site-digger.com/34/%E5%A6%82%E4%BD%95%E6%8A%8A-java%E7%88%AC%E8%99%AB%E7%A8%8B%E5%BA%8F-%E5%B0%81%E8%A3%85%E6%88%90%E5%AE%89%E8%A3%85%E7%A8%8B%E5%BA%8F%EF%BC%9F</link>
<description>已写好Java爬虫程序，如何把它封装成安装程序（数据采集器）？</description>
<category>技术交流</category>
<guid isPermaLink="true">http://spider.site-digger.com/34/%E5%A6%82%E4%BD%95%E6%8A%8A-java%E7%88%AC%E8%99%AB%E7%A8%8B%E5%BA%8F-%E5%B0%81%E8%A3%85%E6%88%90%E5%AE%89%E8%A3%85%E7%A8%8B%E5%BA%8F%EF%BC%9F</guid>
<pubDate>Sat, 12 Nov 2016 07:54:07 +0000</pubDate>
</item>
<item>
<title>如何抓取app数据包（除了fiddler工具）？</title>
<link>http://spider.site-digger.com/33/%E5%A6%82%E4%BD%95%E6%8A%93%E5%8F%96app%E6%95%B0%E6%8D%AE%E5%8C%85%EF%BC%88%E9%99%A4%E4%BA%86fiddler%E5%B7%A5%E5%85%B7%EF%BC%89%EF%BC%9F</link>
<description></description>
<category>技术交流</category>
<guid isPermaLink="true">http://spider.site-digger.com/33/%E5%A6%82%E4%BD%95%E6%8A%93%E5%8F%96app%E6%95%B0%E6%8D%AE%E5%8C%85%EF%BC%88%E9%99%A4%E4%BA%86fiddler%E5%B7%A5%E5%85%B7%EF%BC%89%EF%BC%9F</guid>
<pubDate>Tue, 08 Nov 2016 03:40:16 +0000</pubDate>
</item>
<item>
<title>用JAVA调用报错了，用帮忙看看</title>
<link>http://spider.site-digger.com/31/%E7%94%A8java%E8%B0%83%E7%94%A8%E6%8A%A5%E9%94%99%E4%BA%86%EF%BC%8C%E7%94%A8%E5%B8%AE%E5%BF%99%E7%9C%8B%E7%9C%8B</link>
<description>&lt;p&gt;
	代码： IP和账号密码我换掉了&lt;/p&gt;
&lt;p&gt;
	System.setProperty(&quot;http.proxyHost&quot;, &quot;00.00.00.00&quot;);&amp;nbsp;&lt;/p&gt;
&lt;div&gt;
	System.setProperty(&quot;http.proxyPort&quot;, &quot;62648&quot;);&amp;nbsp;&lt;/div&gt;
&lt;div&gt;
	&amp;nbsp;&lt;/div&gt;
&lt;div&gt;
	URL url = new URL(&quot;http://www.juneyaoair.com/&quot;);&amp;nbsp;&lt;/div&gt;
&lt;div&gt;
	URLConnection uc = url.openConnection();&amp;nbsp;&lt;/div&gt;
&lt;div&gt;
	String encoded = new String&amp;nbsp;&lt;/div&gt;
&lt;div&gt;
	(Base64.decodeBase64(new String(&quot;xxxx:lpwd&quot;).getBytes()));&amp;nbsp;&lt;/div&gt;
&lt;div&gt;
	uc.setRequestProperty(&quot;Proxy-Authorization&quot;, &quot;Basic &quot; + encoded);&amp;nbsp;&lt;/div&gt;
&lt;div&gt;
	uc.connect();&lt;/div&gt;
&lt;div&gt;
	InputStream instream = uc.getInputStream();&lt;/div&gt;
&lt;div&gt;
	StringBuilder sb = new StringBuilder();&lt;/div&gt;
&lt;div&gt;
	int l;&lt;/div&gt;
&lt;div&gt;
	byte[] tmp = new byte[2048];&lt;/div&gt;
&lt;div&gt;
	while ((l = instream.read(tmp)) != -1) {&lt;/div&gt;
&lt;div&gt;
	sb.append(new String(tmp));&lt;/div&gt;
&lt;div&gt;
	}&lt;/div&gt;
&lt;div&gt;
	System.out.println(sb.toString());&lt;/div&gt;
&lt;div&gt;
	&amp;nbsp;&lt;/div&gt;
&lt;div&gt;
	报错信息为：&lt;/div&gt;
&lt;div&gt;
	&lt;div&gt;
		Exception in thread &quot;main&quot; java.io.IOException: Server returned HTTP response code: 407 for URL: http://www.juneyaoair.com/&lt;/div&gt;
	&lt;div&gt;
		at sun.net.www.protocol.http.HttpURLConnection.getInputStream(HttpURLConnection.java:1625)&lt;/div&gt;
	&lt;div&gt;
		at proxy.Demo2.main(Demo2.java:52)&lt;/div&gt;
	&lt;div&gt;
		&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;p&gt;
	&amp;nbsp;&lt;/p&gt;</description>
<category>技术交流</category>
<guid isPermaLink="true">http://spider.site-digger.com/31/%E7%94%A8java%E8%B0%83%E7%94%A8%E6%8A%A5%E9%94%99%E4%BA%86%EF%BC%8C%E7%94%A8%E5%B8%AE%E5%BF%99%E7%9C%8B%E7%9C%8B</guid>
<pubDate>Sun, 18 Sep 2016 13:39:35 +0000</pubDate>
</item>
<item>
<title>怎么利用髙匿HTTP绕过百度api</title>
<link>http://spider.site-digger.com/19/%E6%80%8E%E4%B9%88%E5%88%A9%E7%94%A8%E9%AB%99%E5%8C%BFhttp%E7%BB%95%E8%BF%87%E7%99%BE%E5%BA%A6api</link>
<description>&lt;p&gt;
	&lt;span style=&quot;font-family:georgia,serif;&quot;&gt;怎么利用髙匿HTTP绕过百度api,达到不受调用次数限制。&lt;/span&gt;&lt;/p&gt;</description>
<category>技术交流</category>
<guid isPermaLink="true">http://spider.site-digger.com/19/%E6%80%8E%E4%B9%88%E5%88%A9%E7%94%A8%E9%AB%99%E5%8C%BFhttp%E7%BB%95%E8%BF%87%E7%99%BE%E5%BA%A6api</guid>
<pubDate>Mon, 22 Aug 2016 01:55:47 +0000</pubDate>
</item>
<item>
<title>自己配置的代理高匿代理ip，php curl 多线程抓取百度网盘的数据被封</title>
<link>http://spider.site-digger.com/18/%E8%87%AA%E5%B7%B1%E9%85%8D%E7%BD%AE%E7%9A%84%E4%BB%A3%E7%90%86%E9%AB%98%E5%8C%BF%E4%BB%A3%E7%90%86ip%EF%BC%8Cphp-curl-%E5%A4%9A%E7%BA%BF%E7%A8%8B%E6%8A%93%E5%8F%96%E7%99%BE%E5%BA%A6%E7%BD%91%E7%9B%98%E7%9A%84%E6%95%B0%E6%8D%AE%E8%A2%AB%E5%B0%81</link>
<description>&lt;p&gt;
	linux centen os 6.5 64位，&lt;/p&gt;
&lt;p&gt;
	单网卡多ip，香港站群服务器，&lt;/p&gt;
&lt;p&gt;
	自己配置的squid3.1代理ip，&lt;/p&gt;
&lt;p&gt;
	php curl 多线程抓取百度网盘的数据被封，&lt;/p&gt;
&lt;p&gt;
	自己也做过测试，并用检测工具检测了结果是：高匿代理&lt;/p&gt;
&lt;div&gt;
	代理类型：无代理或高匿代理&lt;/div&gt;
&lt;div&gt;
	REMOTE_ADDR =&amp;nbsp;&lt;/div&gt;
&lt;div&gt;
	HTTP_VIA = 无该头&lt;/div&gt;
&lt;div&gt;
	HTTP_X_FORWARDED_FOR = 无该头&lt;/div&gt;
&lt;div&gt;
	HTTP_PROXY_CONNECTION = 无该头&lt;/div&gt;
&lt;div&gt;
	&amp;nbsp;&lt;/div&gt;
&lt;div&gt;
	服务器独立ip 58个。&lt;/div&gt;
&lt;div&gt;
	只要用多ip同时采集就会被屏蔽。&lt;/div&gt;</description>
<category>技术交流</category>
<guid isPermaLink="true">http://spider.site-digger.com/18/%E8%87%AA%E5%B7%B1%E9%85%8D%E7%BD%AE%E7%9A%84%E4%BB%A3%E7%90%86%E9%AB%98%E5%8C%BF%E4%BB%A3%E7%90%86ip%EF%BC%8Cphp-curl-%E5%A4%9A%E7%BA%BF%E7%A8%8B%E6%8A%93%E5%8F%96%E7%99%BE%E5%BA%A6%E7%BD%91%E7%9B%98%E7%9A%84%E6%95%B0%E6%8D%AE%E8%A2%AB%E5%B0%81</guid>
<pubDate>Sat, 13 Aug 2016 05:20:33 +0000</pubDate>
</item>
<item>
<title>大侠们，哪儿有稳定高匿名的HTTP代理？</title>
<link>http://spider.site-digger.com/16/%E5%A4%A7%E4%BE%A0%E4%BB%AC%EF%BC%8C%E5%93%AA%E5%84%BF%E6%9C%89%E7%A8%B3%E5%AE%9A%E9%AB%98%E5%8C%BF%E5%90%8D%E7%9A%84http%E4%BB%A3%E7%90%86%EF%BC%9F</link>
<description>&lt;p&gt;
	我自己写的爬虫访问网站老是被封IP，返回503错误。从网上找的免费代理绝大多数都不能用...&lt;img alt=&quot;crying&quot; height=&quot;20&quot; src=&quot;http://spider.site-digger.com/qa-plugin/wysiwyg-editor/plugins/smiley/images/cry_smile.gif&quot; title=&quot;crying&quot; width=&quot;20&quot;&gt;。哪位大侠知道有卖稳定高匿名HTTP代理的？&lt;/p&gt;</description>
<category>技术交流</category>
<guid isPermaLink="true">http://spider.site-digger.com/16/%E5%A4%A7%E4%BE%A0%E4%BB%AC%EF%BC%8C%E5%93%AA%E5%84%BF%E6%9C%89%E7%A8%B3%E5%AE%9A%E9%AB%98%E5%8C%BF%E5%90%8D%E7%9A%84http%E4%BB%A3%E7%90%86%EF%BC%9F</guid>
<pubDate>Thu, 21 Jul 2016 09:42:35 +0000</pubDate>
</item>
<item>
<title>一个关于json请求链接的问题</title>
<link>http://spider.site-digger.com/12/%E4%B8%80%E4%B8%AA%E5%85%B3%E4%BA%8Ejson%E8%AF%B7%E6%B1%82%E9%93%BE%E6%8E%A5%E7%9A%84%E9%97%AE%E9%A2%98</link>
<description>我想要提取网盘分享链接里的下载地址，其中需要请求一条json数据，但是这个json请求的链接生成方式没有找到，比如 &lt;A HREF=&quot;http://pan.baidu.com/s/1bclxh0，这个网盘的分享链接，它需要请求这个链接&quot; rel=&quot;nofollow&quot;&gt;http://pan.baidu.com/s/1bclxh0，这个网盘的分享链接，它需要请求这个链接&lt;/A&gt; &lt;A HREF=&quot;http://pan.baidu.com/api/sharedownload?sign=53c9e48437fc1711028f9f66018c05c0eacfd0ab&amp;amp;timestamp=1468829994&amp;amp;bdstoken=&amp;amp;channel=chunlei&amp;amp;web=1&amp;amp;app_id=250528&amp;amp;logid=MTQ2ODgzMDAxMjUxMDAuMDk2MDkxOTY3NDUxMDYyNTI=&amp;amp;clienttype=0，这个链接里面logid的生成方式一直无法找到，请问有什么好的办法吗&quot; rel=&quot;nofollow&quot;&gt;http://pan.baidu.com/api/sharedownload?sign=53c9e48437fc1711028f9f66018c05c0eacfd0ab&amp;amp;timestamp=1468829994&amp;amp;bdstoken=&amp;amp;channel=chunlei&amp;amp;web=1&amp;amp;app_id=250528&amp;amp;logid=MTQ2ODgzMDAxMjUxMDAuMDk2MDkxOTY3NDUxMDYyNTI=&amp;amp;clienttype=0，这个链接里面logid的生成方式一直无法找到，请问有什么好的办法吗&lt;/A&gt;</description>
<category>技术交流</category>
<guid isPermaLink="true">http://spider.site-digger.com/12/%E4%B8%80%E4%B8%AA%E5%85%B3%E4%BA%8Ejson%E8%AF%B7%E6%B1%82%E9%93%BE%E6%8E%A5%E7%9A%84%E9%97%AE%E9%A2%98</guid>
<pubDate>Mon, 18 Jul 2016 08:22:44 +0000</pubDate>
</item>
<item>
<title>掌握Web数据抓取所需要学会的技能</title>
<link>http://spider.site-digger.com/10/%E6%8E%8C%E6%8F%A1web%E6%95%B0%E6%8D%AE%E6%8A%93%E5%8F%96%E6%89%80%E9%9C%80%E8%A6%81%E5%AD%A6%E4%BC%9A%E7%9A%84%E6%8A%80%E8%83%BD</link>
<description>请问一下要想掌握Web数据抓取，都需要学习哪些语言？ 掌握哪些技能？&lt;br /&gt;
&lt;br /&gt;
谢谢</description>
<category>技术交流</category>
<guid isPermaLink="true">http://spider.site-digger.com/10/%E6%8E%8C%E6%8F%A1web%E6%95%B0%E6%8D%AE%E6%8A%93%E5%8F%96%E6%89%80%E9%9C%80%E8%A6%81%E5%AD%A6%E4%BC%9A%E7%9A%84%E6%8A%80%E8%83%BD</guid>
<pubDate>Wed, 31 Oct 2012 06:30:06 +0000</pubDate>
</item>
<item>
<title>携程网抓取问题（post方式）</title>
<link>http://spider.site-digger.com/7/%E6%90%BA%E7%A8%8B%E7%BD%91%E6%8A%93%E5%8F%96%E9%97%AE%E9%A2%98%EF%BC%88post%E6%96%B9%E5%BC%8F%EF%BC%89</link>
<description>抓取某个城市的酒店信息得到list页面时，需要使用post方式发送数据，数据的末尾部分有类似“&amp;amp;HotelSity=MjAxMi0yLTI5IDE0OjUzOjQyfDEw&amp;amp;HotelSityEx=ctrip_hotels_ask_875445string”&lt;br /&gt;
&lt;br /&gt;
的一部分，而且过一段时间就变化一下，请问如何构造这部分动态数据？</description>
<category>技术交流</category>
<guid isPermaLink="true">http://spider.site-digger.com/7/%E6%90%BA%E7%A8%8B%E7%BD%91%E6%8A%93%E5%8F%96%E9%97%AE%E9%A2%98%EF%BC%88post%E6%96%B9%E5%BC%8F%EF%BC%89</guid>
<pubDate>Tue, 28 Feb 2012 17:57:57 +0000</pubDate>
</item>
<item>
<title>[微博]微博信息检索的一般流程</title>
<link>http://spider.site-digger.com/5/%E5%BE%AE%E5%8D%9A-%E5%BE%AE%E5%8D%9A%E4%BF%A1%E6%81%AF%E6%A3%80%E7%B4%A2%E7%9A%84%E4%B8%80%E8%88%AC%E6%B5%81%E7%A8%8B</link>
<description>微博信息数据的采集、检索是当前一个技术热点。我想问各位做过这方面技术的朋友，做这些的大致流程是什么，以具体例子来说，我要输入一个关键词，然后希望得到相关的微博列表，目前有两种方法：&lt;br /&gt;
1、使用新浪微博的API，可是发现只能得到一页数据，要得到更多，得用钱来购买授权&lt;br /&gt;
2、使用新浪的搜索功能，在线模拟登陆、模拟ajax请求、得到返回数据&lt;br /&gt;
&lt;br /&gt;
第二种方法无疑是最难的，我想知道&lt;br /&gt;
&lt;br /&gt;
1、还是不是有其它的方法；2、第二步中模拟登陆、ajax请求发送、得到返回数据，大家都用了什么手段或者工具&lt;br /&gt;
&lt;br /&gt;
谢谢</description>
<category>技术交流</category>
<guid isPermaLink="true">http://spider.site-digger.com/5/%E5%BE%AE%E5%8D%9A-%E5%BE%AE%E5%8D%9A%E4%BF%A1%E6%81%AF%E6%A3%80%E7%B4%A2%E7%9A%84%E4%B8%80%E8%88%AC%E6%B5%81%E7%A8%8B</guid>
<pubDate>Fri, 30 Dec 2011 06:56:05 +0000</pubDate>
</item>
<item>
<title>社区LOGO征集</title>
<link>http://spider.site-digger.com/3/%E7%A4%BE%E5%8C%BAlogo%E5%BE%81%E9%9B%86</link>
<description>&lt;p&gt;
	社区LOGO征集中，各位可在回复本贴的同时上传自己的作品。&lt;/p&gt;
&lt;p&gt;
	&lt;strong&gt;图片上传方法：&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;
	点击“图像”按钮-&amp;gt;切换到“上传”标签-&amp;gt;选择本地文件-&amp;gt;点击“上传到服务器”按钮。&lt;/p&gt;
&lt;p&gt;
	&lt;strong&gt;&lt;span style=&quot;color:#ff0000;&quot;&gt;多谢大家的支持！&lt;/span&gt;&lt;/strong&gt;&lt;/p&gt;</description>
<category>社区事务</category>
<guid isPermaLink="true">http://spider.site-digger.com/3/%E7%A4%BE%E5%8C%BAlogo%E5%BE%81%E9%9B%86</guid>
<pubDate>Sat, 10 Dec 2011 16:23:18 +0000</pubDate>
</item>
<item>
<title>加入华蛛社区，一起交流Web数据采集技术</title>
<link>http://spider.site-digger.com/1/%E5%8A%A0%E5%85%A5%E5%8D%8E%E8%9B%9B%E7%A4%BE%E5%8C%BA%EF%BC%8C%E4%B8%80%E8%B5%B7%E4%BA%A4%E6%B5%81web%E6%95%B0%E6%8D%AE%E9%87%87%E9%9B%86%E6%8A%80%E6%9C%AF</link>
<description>&lt;p&gt;
	欢迎来到 『华蛛社区』, 你可以在这里提问和回复，来跟其它用户一起交流。&lt;/p&gt;
&lt;p&gt;
	让我们共同打造中国第一个专业Web数据采集技术交流社区！&lt;/p&gt;
&lt;p&gt;
	本社区由&lt;a rel=&quot;nofollow&quot; href=&quot;http://www.site-digger.com&quot; target=&quot;_blank&quot;&gt;鲲鹏数据&lt;/a&gt;强力支持。&lt;/p&gt;
&lt;p&gt;
	&amp;nbsp;&lt;/p&gt;
&lt;p&gt;
	名字的由来？&lt;/p&gt;
&lt;p&gt;
	华蛛社区 - 寓意“中华蜘蛛”。&lt;/p&gt;</description>
<category>社区事务</category>
<guid isPermaLink="true">http://spider.site-digger.com/1/%E5%8A%A0%E5%85%A5%E5%8D%8E%E8%9B%9B%E7%A4%BE%E5%8C%BA%EF%BC%8C%E4%B8%80%E8%B5%B7%E4%BA%A4%E6%B5%81web%E6%95%B0%E6%8D%AE%E9%87%87%E9%9B%86%E6%8A%80%E6%9C%AF</guid>
<pubDate>Sat, 10 Dec 2011 10:05:25 +0000</pubDate>
</item>
</channel>
</rss>