php数据抓取采集 phpyun采集

php 百度知道数据采集

问题其实不难，自己都能写。给你几个思路吧：

目前创新互联建站已为上千余家的企业提供了网站建设、域名、网站空间、网站托管、服务器托管、企业网站设计、仁化网站维护等服务，公司将坚持客户导向、应用为本的策略，正道将秉承"和谐、参与、激情"的文化，与客户和合作伙伴齐心协力一起成长，共同发展。

1.在百度知道中，输入linux，然后会出现列表。复制浏览器地址栏内容。

然后翻页，在复制地址栏内容，看看有什么不同，不同之处，就是你要循环分页的i值。

当然这个是笨方法。

2.使用php的file或者file_get_contents函数，获取链接URL的内容。

3.通过php正则表达式，获取你需要的3个字段内容。

4.写入数据库。

需要注意的是，百度知道有可能做了防抓取的功能，你刚一抓几个页面，可能会被禁止。

建议也就抓10页数据。

其实不难，你肯定写的出来。还有，网上应该有很多抓取工具，你找找看，然后将抓下来的数据

在做分析。写入数据库。

以前我用过querylist插件抓数据，服务器写和定时器，每天固定时间去运行脚本。朝这个方式试试

高并发下数据的更新，应该 update table xxx set num = num - 1 的方式，这种方式可以保证数据的正确性。

但是会出现 num 为负数的问题，如果库存为负数，显然是不合理的。

于是，需要将 num 字段设置为无符号整型，这样就不会出现负数了，因为，如果减到负数，就会更新失败。

但是这种依然会造成很多无用的更新语句的执行，是不合理的。

于是，update table xxx set num = num - 1 where num 0，

这样当 num 等于0之后就不会去更新数据库了，减少了很多无用的开销。

这种方式被称作“乐观锁”

此外，对于抢红包这种非整数的操作，我们应该转换为整数的操作。

关于抢购超卖的控制

一般抢购功能是一个相对于正常售卖系统来说独立的子系统，这样既可以防止抢购时的高并发影响到正常系统，

也可以做到针对于抢购业务的特殊处理。

在后台设计一些功能，可以就昂正常的商品加入到抢购活动中并编辑成为抢购商品，写入到抢购商品表，当然

也可以把抢购商品表写入redis而不是数据表。并且在原商品表写入一个同样的商品（id相同，用于订单查看，

此商品不可购买）

如果是数据表，为了控制超卖，需要对表进行行锁，更新的时候带上 where goods_amount 0。

如果是redis，使用 hincrby 一个负数来减库存，并且 hincrby 会返回改变后的值，再来判断返回值是否大于0，

因为redis每个命令都是原子性的，这样不用锁表就可控制超卖。

简单的分了几个步骤：

1、确定采集目标

2、获取目标远程页面内容（curl、file_get_contents）

3、分析页面html源码，正则匹配你需要的内容（preg_match、preg_match_all），这一步最为重要，不同页面正则匹配规则不一样

4、入库

分享题目：php数据抓取采集 phpyun采集
文章来源：http://azwzsj.com/article/ddgsjpd.html