为了账号安全,请及时绑定邮箱和手机立即绑定

请教一下java怎么关闭phantomjs?

/ 猿问

请教一下java怎么关闭phantomjs?

qq_遁去的一_1 2019-10-14 14:10:44

java怎么关闭phantomjs


查看完整描述

3 回答

?
翻翻过去那场雪

mac os x 环境 本人亲自测试ok:
1 安装phantomjs
brew install phantomjs
2 建立js文件

/**
* Created by xiehonghao on 16-7-24.
*/
//codes.js
system = require('system')
address = system.args[1];//获得命令行第二个参数 接下来会用到
//console.log('Loading a web page');
var page = require('webpage').create();
var url = address;
//console.log(url);
page.open(url, function (status) {
//Page is loaded!
if (status !== 'success') {
console.log('Unable to post!');
} else {
//console.log(page.content);
//var title = page.evaluate(function() {
// return document.title;//示范下如何使用页面的jsapi去操作页面的 www.oicqzone.com
// });
//console.log(title);

console.log(page.content);
}
phantom.exit();
});

3 测试文件
/**
* Created by xiehonghao on 16-7-24.
*/
public class HttpUtils {
public static String getAjaxCotnent(String url) throws IOException {
Runtime rt = Runtime.getRuntime();
//phantomjs 和codes.js的路径之间有个空格 本代码只是测试用的绝对路径
Process p = rt.exec("phantomjs /Users/hackdream/xiehonghao/gebilaowang/src/main/java/org/gebilaowang/utils/codes.js "+url);
InputStream is = p.getInputStream();
BufferedReader br = new BufferedReader(new InputStreamReader(is));
StringBuffer sbf = new StringBuffer();
String tmp = "";
while((tmp = br.readLine())!=null){
sbf.append(tmp);
}
//System.out.println(sbf.toString());
return sbf.toString();
}

public static void main(String[] args) throws IOException {
String content = getAjaxCotnent("http://cq.qq.com/baoliao/detail.htm?294064");
assert content != null;
}
}



查看完整回答
反对 回复 2019-10-26
?
一只甜甜圈

phantomjs为什么只爬取了部分js代码
  phantomjs 抓取js动态加载数据的方法:
  phantomjs因为是无头浏览器可以跑js,用来进行网页抓取是再好不过了。
  比如我们要批量抓取网页 “历史上的今天” 的内容。
  第一行将会在终端打印出字符串,第二行 phantom.exit 将退出运行。
在该脚本中调用 phantom.exit 是非常重要的,否则 PhantomJS 将根本不会停 止。 pyspider 连上 PhantomJS 代理后,你就能通过在 self.crawl 添加 fetch_type='js' 的参数,开启使用 PhantomJS 抓取。

查看完整回答
反对 回复 2019-10-26
?
慕桂英4014372

日前有采集需求,当我把所有的对应页面的链接都拿到手,准备开始根据链接去采集(写爬虫爬取)对应的终端页的时候,发觉用程序获取到的数据根本没有对应的内容,可是我的浏览器看到的内容明明是有的,于是浏览器查看源代码也发觉没有,此时想起该网页应该是ajax加载的。不知道ajax的小朋友可以去学下web开发啦。
采集ajax生成的内容手段不外乎两种。一种是通过http观察加载页面时候的请求,然后我们模仿该请求去得到对应的内容,第二种则是模仿浏览器行为去渲染这个页面得到内容。我在这里决定采用第二种方式,之前一直玩webkit,不过一直要加载页面太浪费资源了,此时了解到有一个好玩的玩意phantomjs,这是个可以用命令行来操作webkit的玩意,然后也可以直接在里面用js的api去操作页面(当然,我这边比较简单就懒得用了)。
//codes.js
system = require('system')
address = system.args[1];//获得命令行第二个参数 接下来会用到
//console.log('Loading a web page');
var page = require('webpage').create();
var url = address;
//console.log(url);
page.open(url, function (status) {
//Page is loaded!
if (status !== 'success') {
console.log('Unable to post!');
} else {
//console.log(page.content);
//var title = page.evaluate(function() {
// return document.title;//示范下如何使用页面的jsapi去操作页面的 www.oicqzone.com
// });
//console.log(title);

console.log(page.content);
}
phantom.exit();
});
接下来贴java代码!
[java] view plain copy
import org.apache.commons.io.IOUtils;

import java.io.*;

public class HttpUtils {
public static String getAjaxCotnent(String url) throws IOException {
Runtime rt = Runtime.getRuntime();
Process p = rt.exec("phantomjs.exe c:/phantomjs/codes.js "+url);//这里我的codes.js是保存在c盘下面的phantomjs目录
InputStream is = p.getInputStream();
BufferedReader br = new BufferedReader(new InputStreamReader(is));
StringBuffer sbf = new StringBuffer();
String tmp = "";
while((tmp = br.readLine())!=null){
sbf.append(tmp);
}
//System.out.println(sbf.toString());
return sbf.toString();
}

public static void main(String[] args) throws IOException {
getAjaxCotnent("http://www.baidu.com");
}
}



查看完整回答
反对 回复 2019-10-26

添加回答

回复

举报

0/150
提交
取消
意见反馈 帮助中心 APP下载
官方微信