代理加盟 2019全新代理计划 赚钱+省钱双管齐下,独立平台,丰厚利润!

您现在的位置: 188bet网 > 织梦大学 > 织梦采集 >

织梦后台自带采集工具使用教程

来源:未知 发布时间:2019-04-13热度:我要评论
织梦后台自带一个采集工具,但是大家貌似都很陌生,可能因为不实用吧,也可能市场上有更好的工具来替代,上一篇教程 最详细火车头数据采集系统DedeCMS发布文章攻略 ,我们也介绍了今天我们来介绍下织梦后台自带采集功能使用方法,dedecms自带了文章和图片采集功能,对...

织梦后台自带一个采集工具,但是大家貌似都很陌生,可能因为不实用吧,也可能市场上有更好的工具来替代,上一篇教程最详细火车头数据采集系统DedeCMS发布文章攻略,我们也介绍了今天我们来介绍下织梦后台自带采集功能使用方法,dedecms自带了文章和图片采集功能,对于不熟悉的新手建站,采集规则配置起来很麻烦,经常在采集时出错,或者乱码,现在就向朋友介绍dedecms的采集功能。

一、进入采集节点管理界面,在后台管理界面的主菜单中单击“采集”,然后单击“采集节点管理”,即可进入采集节点管理界面。

二、在采集节点管理界面中,单击左下角的“增加新节点”或者右上角的“添加新节点”如图,都可进入“选择内容模型”界面,如图所示,

织梦后台自带采集工具使用教程
 
 

三、设置节点基本信息

织梦采集,采集工具,织梦后台采集功能使用

 

四、目标页面编码:设定被采集目标页的编码格式,有GB2312、UTF8和BIG5三种。可通过在被采集目标页面上,单击右键后选择“查看源文件”来获取。

 
操作步骤:
 
(a)打开被采集的目标页:http://网站域名/knowledge/web-based/dreamweaver/;
 
单击右键后选择“查看源文件”,找到“charset
 
织梦后台自带采集工具使用教程
 

五、其等号后面的代码就是所需的“编码格式”,这里是“gb2312”。

“区域匹配模式”:设定如何匹配所需采集的内容部分,可采用字符串或者正则表达式。系统默认的模式是字符串。如果比较了解正则表达式的朋友,可以在这里选择正则表达式的模式。

“内容导入顺序”:指定文章列表导入时候的顺序,可以选择“与目标站一致”或“与目标站相反”。

“防盗链模式”:针对被采集的目标站点有无刷新限制。一开始很难判断出来,需要测试后才能知道。如果有的话,这里需要设置一下“资源下载超时时间”。

“引用网址”:填入任何一个即将被采集的文章内容页面的网址。

在已打开的文章列表页中,单击第一篇文章的

织梦采集工具,织梦采集使用教程

六、此时在浏览器的URL地址栏中显示的网址,即为需要填写在“引用网址”处的网址,如(图)所示

织梦采集工具,织梦采集教程

七、到这里,“节点基本信息”就设置完成了。最后结果,如(图)所示,

织梦采集工具,织梦采集插件,采集教程

八、检查无误后,进入下一步设置。设置列表网址获取规则

采集工具,采集插件,织梦采集使用

这里是设置被采集的文章列表页的匹配规则。如果被采集的文章列表页有一定的规律,可选择“批量生成列表网址”;如果被采集的文章列表页完全没有规律可循,那么可选择“手工指定列表网址”;如果被采集的站点提供了RSS,则可以选择“从RSS中获取”。对于特殊情况,例如:部分列表页有规律,而其余的又没有规律,则可在“匹配网址”中填上有规律的部分,然后把没有规律的部分填写在“手动指定网址”。

 

本文地址:https://www.ms88kzm.com/dedecms_cj/1633.html

    责任编辑:188bet网

    发表评论

    评论列表(条)