首页建站经验 PHP实现简单爬虫的方法

PHP实现简单爬虫的方法

本文实例讲述了PHP实现简单爬虫的方法。分享给大家供大家参考。具体如下:…

本文实例讲述了PHP实现简单爬虫的方法。分享给大家供大家参考。具体如下:

<?php

/**

* 爬虫程序 -- 原型

*

* 从给定的url获取html内容

*

* @param string $url

* @return string

*/

function _getUrlContent($url) {

$handle = fopen($url, "r");

if ($handle) {

$content = stream_get_contents($handle, 1024 * 1024);

return $content;

} else {

return false;

}

}

/**

* 从html内容中筛选链接

*

* @param string $web_content

* @return array

*/

function _filterUrl($web_content) {

$reg_tag_a = '/<[a|A].*?href=[/'/"]{0,1}([^>/'/"/ ]*).*?>/';

$result = preg_match_all($reg_tag_a, $web_content, $match_result);

if ($result) {

return $match_result[1];

}

}

/**

* 修正相对路径

*

* @param string $base_url

* @param array $url_list

* @return array

*/

function _reviseUrl($base_url, $url_list) {

$url_info = parse_url($base_url);

$base_url = $url_info["scheme"] . '://';

if ($url_info["user"] && $url_info["pass"]) {

$base_url .= $url_info["user"] . ":" . $url_info["pass"] . "@";

}

$base_url .= $url_info["host"];

if ($url_info["port"]) {

$base_url .= ":" . $url_info["port"];

}

$base_url .= $url_info["path"];

print_r($base_url);

if (is_array($url_list)) {

foreach ($url_list as $url_item) {

if (preg_match('/^http/', $url_item)) {

// 已经是完整的url

$result[] = $url_item;

} else {

// 不完整的url

$real_url = $base_url . '/' . $url_item;

$result[] = $real_url;

}

}

return $result;

} else {

return;

}

}

/**

* 爬虫

*

* @param string $url

* @return array

*/

function crawler($url) {

$content = _getUrlContent($url);

if ($content) {

$url_list = _reviseUrl($url, _filterUrl($content));

if ($url_list) {

return $url_list;

} else {

return ;

}

} else {

return ;

}

}

/**

* 测试用主程序

*/

function main() {

$current_url = "http://hao123.com/"; //初始url

$fp_puts = fopen("url.txt", "ab"); //记录url列表

$fp_gets = fopen("url.txt", "r"); //保存url列表

do {

$result_url_arr = crawler($current_url);

if ($result_url_arr) {

foreach ($result_url_arr as $url) {

fputs($fp_puts, $url . "/r/n");

}

}

} while ($current_url = fgets($fp_gets, 1024)); //不断获得url

}

main();

?>

希望本文所述对大家的php程序设计有所帮助。

本文来自网络,不代表1号站长-站长学院|资讯交流平台立场。转载请注明出处: https://www.1cn.cc/jianzhan/jingyan/18232.html
上一篇PHP模拟QQ登录的方法
下一篇 PHP之正则表达式捕获组与非捕获组(详解)
admin

作者: admin

这里可以再内容模板定义一些文字和说明,也可以调用对应作者的简介!或者做一些网站的描述之类的文字或者HTML!

为您推荐

评论列表()

    联系我们

    联系我们

    0898-88888888

    在线咨询: QQ交谈

    邮箱: email@wangzhan.com

    工作时间:周一至周五,9:00-17:30,节假日休息

    关注微信
    微信扫一扫关注我们

    微信扫一扫关注我们

    关注微博
    返回顶部