您好,欢迎访问一九零五行业门户网

详细介绍PHP+JavaScript如何爬取网页内容

本篇文章给大家分享的内容是详细介绍php+javascript如何爬取网页内容,有着一定的参考价值,有需要的朋友可以参考一下
php+js爬取网页内容—–先看下效果
如何做到的呢?我们一直以为只有python才能爬取网页内容,那是因为python本身集合很多类库用来爬取网页很方便,但是我们使用php+js的方法一样很方便,一样可以拿到我们想要的网页内容,而且也不用很繁琐。
首先我们需要php来模拟请求获取整个网站的html // 允许所有域访问 header("access-control-allow-origin: *"); / 接收一个参数,参数名叫parm $parm=$_get['mod']; if (empty($parm)) { $url = 'http://m.80s.tw/';//目标网站 $html = file_get_contents($url); }else{ $url = 'http://m.80s.tw/'.$parm; $html = file_get_contents($url); } preg_match("/<body[^>]*?>(.*\s*?)<\/body>/is",$html,$match1);//正则匹配body里面的内容 echo $match1[0];//输出网页
注意:如果遇到 file_get_contents报错请尝试在 php.ini中找到extension=php_openssl.dll 开启就ok了然后就是前端来获取数据进行处理了首先写个异步请求
$.ajax({ type:'get', url: '.././admin/test.php', success: function(data) { console.log(data)//可以看到获取的html,很简单吧,很兴奋吧 } });
获取html后我们就可以随心所欲了怎么来使用这些html呢?这是问题吗?不是 //首先创建一个容器 var p = document.createelement('p'); // 把整个html的字符串存到这个p节点里 p.innerhtml = data; //然后就可以对p一顿检查了 //比如获取类list_mov_title下所有的a标签 var list = p.queryselectorall('.list_mov_title a'); //赶紧打印出来看一下 console.log(list) //想要的东西都在吧 //然后就把想要的东西往自己的页面里面塞吧
一个爬取网页内容的教程就这样结束了,如果你豁然开朗了就转发一下吧,不明白的就留言吧
以上就是详细介绍php+javascript如何爬取网页内容的详细内容。
其它类似信息

推荐信息