类别:PHP问题 / 日期:2019-12-02 / 浏览:68 / 评论:0

说到做爬虫,人人都能够第一时间想到的是python,实在php也是可以用来写爬虫顺序的。php一向简约、易用,亲测运用PHPspider框架能写出一个简朴的爬虫。

婚配体式格局运用XPach语法。 (引荐进修:PHP视频教程)

<?php
require '/vendor/autoload.php';
use phpspider\core\phpspider;

/* Do NOT delete this comment */
/* 不要删除这段解释 */

$configs = array(
'name' => '简书',
'log_show' =>false,
'tasknum' => 1,
//数据库设置
'db_config' => array(
'host'  => '127.0.0.1',
'port'  => 3306,
'user'  => 'root',
'pass'  => '',
'name'  => 'demo',
),
'export' => array(
'type' => 'db',
'table' => 'jianshu',  // 假如数据表没有数据新增请检查表构造和字段名是不是婚配
),
//爬取的域名列表  
'domains' => array(
    'jianshu',
    'www.jianshu.com'
), 
//抓取的出发点
'scan_urls' => array(
    'https://www.jianshu.com/c/V2CqjW?utm_medium=index-collections&utm_source=desktop'
),
//列表页实例
'list_url_regexes' => array(
    "https://www.jianshu.com/c/\d+"
),
//内容页实例
//  \d+  指的是变量
'content_url_regexes' => array(
    "https://www.jianshu.com/p/\d+",
),
'max_try' => 5,

'fields' => array(
    array(
        'name' => "title",
        'selector' => "//h1[@class='title']",
        'required' => true,
    ),
    array(
        'name' => "content",
        'selector' => "//div[@class='show-content-free']",
        'required' => true,
    ),
),
);

$spider = new phpspider($configs);
$spider->start();

打完代码后,记得依据要抓取的内容竖立对应的数据库、数据表,字段要能对对上。

接着cmd,输入

php -f d:\jianshu\spider.php

运转以下

以上就是php爬虫怎样运转的细致内容,更多请关注ki4网别的相干文章!

打赏

感谢您的赞助~

打开支付宝扫一扫,即可进行扫码打赏哦~

版权声明 : 本文未使用任何知识共享协议授权,您可以任何形式自由转载或使用。

 可能感兴趣的文章

评论区

发表评论 / 取消回复

必填

选填

选填

◎欢迎讨论,请在这里发表您的看法及观点。