网站之家技术交流论坛

 找回密码
 立即注册

QQ登录

只需一步,快速开始

查看: 13251|回复: 168

DedeCMS V5.7全文检索使用说明

[复制链接]
发表于 2011-3-8 11:04:00 | 显示全部楼层 |阅读模式
首先了解一下sphinx全文索引的相关知识,考虑到Sphinx全文索引使用的实际需要,主要介绍Sphinx全文索引中文方面的支持。这里需要感谢李沫南同学对Sphinx全文索引中文支持的贡献!

官方网站:http://www.sphinxsearch.com/
官方文档:http://www.sphinxsearch.com/docs/
中文支持:http://www.coreseek.cn/
中文使用手册下载:
中文在线手册:http://www.coreseek.cn/docs/coreseek_3.2-sphinx_0.9.9.html

1.Windows下安装Sphinx
1.1.开始前的准备工作
先从http://www.coreseek.cn/products/ft_down/下载Coreseek 3.2.13,这里我们就以Windows环境为例:
下载后直接解压coreseek-3.2.13-win32.zip,我们这里假设解压到:D:coreseek-3.2.13-win32.这里我们需要简单了解几个目录:

[D:coreseek-3.2.13-win32api]API接口目录,其中包括了php,python,ruby等操作实例,其中test_coreseek.php是一个不错的中文检索的例子.

[D:****bin]应用程序目录,其中包含以下几个文件
    * indexer: 用于创建全文索引;
    * search: 一个简单的命令行(CLI) 的测试程序,用于测试全文索引;
    * searchd: 一个守护进程,其他软件可以通过这个守护进程进行全文检索;
    * sphinxapi: 一系列searchd 的客户端API 库,用于流行的Web脚本开发语言(PHP, Python, Perl, Ruby, Java).
    * spelldump: 一个简单的命令行工具,用于从 ispell 或 MySpell (OpenOffice内置绑定) 格式的字典中提取词条。当使用 wordforms 时可用这些词条对索引进行定制.
    * indextool: 工具程序,用来转储关于索引的多项调试信息。 此工具是从版本Coreseek 3.1(Sphinx 0.9.9-rc2)开始加入的。
    * mmseg: 工具程序和库,Coreseek用于提供中文分词和词典处理。

[D:****etc]sphinx配置目录
[D:****var]sphinx变量&索引&日志存放目录

1.2.创建配置文件
由于dedecms使用的是mysql,所以我们需要来配置一个mysql的sphinx模板配置,可以复制csft_mysql.conf改名为:csft_dedecmsv57.conf,例如我们这里仅做文章的全文检索,我们需要做如下配置:
先在DedeCMS中创建一个统计表,方法可以在DedeCMS后台[系统]->[SQL命令行工具]中执行下列代码:
CREATE TABLE `dede_sphinx` (
    `countid` int(11) unsigned NOT NULL,
    `maxaid` int(11) unsigned NOT NULL,
    PRIMARY KEY (`countid`)
) ENGINE=MyISAM DEFAULT CHARSET=gbk
这是一个sphinx内容统计表,为了适合数据量较大的情况下分批生成索引而使用的.
创建完数据表后,我们对sphinx的配置文件,即csft_dedecmsv57.conf修改,内容如下,其中包含注释:
--------------------------------------------------------------------------------------------

#源定义
source mysql
{
    type                    = mysql

    # 数据库服务器基本配置信息
    sql_host                = 192.168.0.103
    sql_user                = dedev57
    sql_pass                = dedecms
    sql_db                  = dedecmsv57gbk
    sql_port                = 3306
   
    # 设定编码,这里我们是gbk编码,如果是utf-8,可以设置:
    # sql_query_pre            = SET NAMES utf8
    sql_query_pre            = SET NAMES gbk
   
    # 数据检索增量
    sql_range_step = 1000
   
    #当前最新文档id数
    sql_query_pre = REPLACE INTO dede_sphinx SELECT 1, MAX(id) FROM dede_archives
   
    #检索条件
    sql_query               = SELECT ARC.id,ARC.typeid,ARC.typeid2,ARC.sortrank,ARC.flag,ARC.channel,ARC.ismake,ARC.arcrank,ARC.click,ARC.title,ARC.shorttitle,ARC.color,ARC.writer,ARC.source,ARC.litpic,ARC.pubdate,ARC.senddate,ARC.mtype,ARC.description,ARC.badpost,ARC.goodpost,ARC.scores,ARC.lastpost,ARC.keywords,ARC.mid,ART.body FROM dede_archives AS ARC LEFT JOIN dede_addonarticle AS ART ON ARC.id = ART.aid WHERE ARC.id>=$start AND ARC.id<=$end #sql_query第一列id需为整数
    #title、body作为字符串/文本字段,被全文索引
   
    # 获取当前最大检索id
    sql_query_range  = SELECT 1,maxaid FROM dede_sphinx WHERE countid=1

                                            
    sql_attr_uint             = typeid            #从SQL读取到的值必须为整数
    sql_attr_uint            = typeid2
    sql_attr_uint            = channel
    sql_attr_uint            = click
    sql_attr_uint            = badpost
    sql_attr_uint            = goodpost
    sql_attr_uint            = scores
    sql_attr_uint            = mid
    sql_attr_timestamp  = pubdate    #从SQL读取到的值必须为整数,作为时间属性
    sql_attr_timestamp  = senddate
    sql_attr_timestamp  = lastpost

    #命令行查询时,从数据库读取原始数据信息
    sql_query_info            = SELECT ARC.*,ART.body FROM dede_archives AS ARC LEFT JOIN dede_addonarticle AS ART ON ARC.id = ART.aid WHERE ARC.id=$id  
}

source delta
{
    type                    = mysql

    # 数据库服务器基本配置信息
    sql_host                = 192.168.0.103
    sql_user                = dedev57
    sql_pass                = dedecms
    sql_db                  = dedecmsv57gbk
    sql_port                = 3306
    sql_query_pre            = SET NAMES gbk

    # 增量索引,从最大id开始
    sql_query = SELECT ARC.id,ARC.typeid,ARC.typeid2,ARC.sortrank,ARC.flag,ARC.channel,ARC.ismake,ARC.arcrank,ARC.click,ARC.title,ARC.shorttitle,ARC.color,ARC.writer,ARC.source,ARC.litpic,ARC.pubdate,ARC.senddate,ARC.mtype,ARC.description,ARC.badpost,ARC.goodpost,ARC.scores,ARC.lastpost,ARC.keywords,ARC.mid,ART.body FROM dede_archives AS ARC LEFT JOIN dede_addonarticle AS ART ON ARC.id = ART.aid WHERE ARC.id > ( SELECT maxaid FROM dede_sphinx WHERE countid=1 )
    #从SQL读取到的值必须为整数
   
    sql_query_post = REPLACE INTO dede_sphinx SELECT 1, MAX(id) FROM dede_archives
   
    sql_attr_uint             = typeid            
    sql_attr_uint            = typeid2
    sql_attr_uint            = channel
    sql_attr_uint            = click
    sql_attr_uint            = badpost
    sql_attr_uint            = goodpost
    sql_attr_uint            = scores
    sql_attr_uint            = mid
    sql_attr_timestamp  = pubdate    #从SQL读取到的值必须为整数,作为时间属性
    sql_attr_timestamp  = senddate
    sql_attr_timestamp  = lastpost

    #命令行查询时,从数据库读取原始数据信息
    sql_query_info            = SELECT ARC.*,ART.body FROM dede_archives AS ARC LEFT JOIN dede_addonarticle AS ART ON ARC.id = ART.aid WHERE ARC.id=$id  
}


#index定义
index mysql
{
    source            = mysql             #对应的source名称
    path            = D:/coreseek-3.2.13-win32/var/data/mysql
    docinfo            = extern
    mlock            = 0
    morphology        = none
    min_word_len        = 1
    html_strip                = 0
    #charset_dictpath = /usr/local/mmseg3/etc/    #BSD、Linux环境下设置,/符号结尾
    charset_dictpath = D:/coreseek-3.2.13-win32/etc/                        #Windows环境下设置,/符号结尾
    charset_type        = zh_cn.gbk
}

index delta : mysql
{
    min_word_len        = 1
    source = delta
    path            = D:/coreseek-3.2.13-win32/var/data/delta.new
}


#全局index定义
indexer
{
    mem_limit            = 128M
}

#searchd服务定义
searchd
{
    listen                  =   9312
    read_timeout        = 5
    max_children        = 30
    max_matches            = 1000
    seamless_rotate        = 0
    preopen_indexes        = 0
    unlink_old            = 1
    pid_file = D:/coreseek-3.2.13-win32/var/log/searchd_mysql.pid
    log = D:/coreseek-3.2.13-win32/var/log/searchd_mysql.log
    query_log = D:/coreseek-3.2.13-win32/var/log/query_mysql.log
}


-------------------------------------------------------------------------------------------------------

1.3.建立索引
配置完成后,我们要先建立索引,在开始菜单中打开[运行],输入"cmd",确认后打开命令行.输入下列代码:

d:&cd D:coreseek-3.2.13-win32bin

先切换到sphinx的bin目录,然后再执行:

indexer.exe -c D:coreseek-3.2.13-win32etccsft_dedecmsv57.conf mysql --rotate

这个时候sphinx开始构建索引,如果数据量比较大,这个时间可能比较长,需要耐心等待(如图1).

图片:DedeCMS V5.7全文检索使用说明-1.gif





然后再创建下增量索引,使用下列命令:
indexer.exe -c D:coreseek-3.2.13-win32etccsft_dedecmsv57.conf delta --rotate


1.4.测试检索是否正常
建立完索引之后我们来检测下是否能够正常搜索到匹配内容,可以继续在cmd中输入下列命令:

search.exe -c D:coreseek-3.2.13-win32etccsft_dedecmsv57.conf dedecms

如果能够正常返回数据(如图2),则说明已经成功建立索引.

图片:DedeCMS V5.7全文检索使用说明-2.gif





2.结合DedeCMS程序使用sphinx
2.1.开启sphinx服务
在上面的步骤中我们已经成功生成了索引,接下来为了能够使用客户端调用则需要开启sphinx服务.
可以直接在cmd中执行:
searchd.exe -c D:coreseek-3.2.13-win32etccsft_dedecmsv57.conf
这样我们就开启了sphinx服务(如图3),我们可以写一个简单的例子进行测试:

图片:DedeCMS V5.7全文检索使用说明-3.gif





sphinx_test.php
--------------------------------------------------------------------------------------------------------
set_time_limit(0);
require_once (dirname(__FILE__) . "/include/common.inc.php");
$sphinx = new SphinxClient;

$mode = SPH_MATCH_ANY;            //匹配模式
$host = "localhost";            //服务ip
$port = 9312;    //服务端口
        
$sphinx->SetServer($host, $port);
$sphinx->SetArrayResult(true);
$sphinx->SetMatchMode($mode);

$res = $sphinx->Query('织梦内容管理系统');

//var_dump($sphinx);
//var_dump($res);
$total = count($res['matches']);
for($i=0; $i < $total; $i++)
{
    var_dump($res['matches'][$i]);
}

-----------------------------------------------------------------------------------------------------
执行sphinx_test.php,可以看到已经能够正常通信,并且返回了内容.

图片:DedeCMS V5.7全文检索使用说明-4.gif





2.2.创建一个DedeSphinx服务
上面我们通过searchd.exe开启了服务,但不好的是,我们关闭了cmd窗口就不能继续访问了,解决办法如下:
同样切换到bin目录下,执行:

searchd.exe --install -c D:coreseek-3.2.13-win32etccsft_dedecmsv57.conf --servicename DedeSphinx
这样就在系统中成功创建了一个DedeSphinx服务,无需再打开窗口(如图5).

图片:DedeCMS V5.7全文检索使用说明-5.gif





3.更新与维护
对于全文检索的索引,我们是需要不定期生成的,如果是数据量比较小,直接使用上述生成索引的命令重建就可以,如果数据量比较大,我们则需要定义的更新全文索引.

如果内容更新比较频繁,下列的命令需要每分钟被执行一次(可以创建一个脚本,使用windows计划任务定期执行)

生成增量索引:

indexer.exe -c D:coreseek-3.2.13-win32etccsft_dedecmsv57.conf delta --rotate

当然每一天都需要将增量索引合并到主索引mysql中去,需要执行:

indexer.exe -c D:coreseek-3.2.13-win32etccsft_dedecmsv57.conf --merge mysql delta --rotate

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

x
回复

使用道具 举报

发表于 2011-3-8 11:04:40 | 显示全部楼层
首先了解一下sphinx全文索引的相关知识,考虑到Sphinx全文索引使用的实际需要,主要介绍Sphinx全文索引中文方面的支持。这里需要感谢李沫南同学对Sphinx全文索引中文支持的贡献!

官方网站:http://www.sphinxsearch.com/
官方文档:http://www.sphinxsearch.com/docs/
中文支持:http://www.coreseek.cn/
中文使用手册下载:http://www.coreseek.cn/uploads/pdf/sphinx_doc_zhcn_0.9.pdf
中文在线手册:http://www.coreseek.cn/docs/coreseek_3.2-sphinx_0.9.9.html

1.Windows下安装Sphinx
1.1.开始前的准备工作
先从http://www.coreseek.cn/products/ft_down/下载Coreseek 3.2.13,这里我们就以Windows环境为例:
下载后直接解压coreseek-3.2.13-win32.zip,我们这里假设解压到:D:coreseek-3.2.13-win32.这里我们需要简单了解几个目录:

[D:coreseek-3.2.13-win32api]API接口目录,其中包括了php,python,ruby等操作实例,其中test_coreseek.php是一个不错的中文检索的例子.

[D:****bin]应用程序目录,其中包含以下几个文件
&#160;&#160;&#160; * indexer: 用于创建全文索引;
&#160;&#160;&#160; * search: 一个简单的命令行(CLI) 的测试程序,用于测试全文索引;
&#160;&#160;&#160; * searchd: 一个守护进程,其他软件可以通过这个守护进程进行全文检索;
&#160;&#160;&#160; * sphinxapi: 一系列searchd 的客户端API 库,用于流行的Web脚本开发语言(PHP, Python, Perl, Ruby, Java).
&#160;&#160;&#160; * spelldump: 一个简单的命令行工具,用于从 ispell 或 MySpell (OpenOffice内置绑定) 格式的字典中提取词条。当使用 wordforms 时可用这些词条对索引进行定制.
&#160;&#160;&#160; * indextool: 工具程序,用来转储关于索引的多项调试信息。 此工具是从版本Coreseek 3.1(Sphinx 0.9.9-rc2)开始加入的。
&#160;&#160;&#160; * mmseg: 工具程序和库,Coreseek用于提供中文分词和词典处理。

[D:****etc]sphinx配置目录
[D:****var]sphinx变量&索引&日志存放目录

1.2.创建配置文件
由于dedecms使用的是mysql,所以我们需要来配置一个mysql的sphinx模板配置,可以复制csft_mysql.conf改名为:csft_dedecmsv57.conf,例如我们这里仅做文章的全文检索,我们需要做如下配置:
先在DedeCMS中创建一个统计表,方法可以在DedeCMS后台[系统]->[SQL命令行工具]中执行下列代码:
CREATE TABLE `dede_sphinx` (
&#160;&#160;&#160; `countid` int(11) unsigned NOT NULL,
&#160;&#160;&#160; `maxaid` int(11) unsigned NOT NULL,
&#160;&#160;&#160; PRIMARY KEY (`countid`)
) ENGINE=MyISAM DEFAULT CHARSET=gbk
这是一个sphinx内容统计表,为了适合数据量较大的情况下分批生成索引而使用的.
创建完数据表后,我们对sphinx的配置文件,即csft_dedecmsv57.conf修改,内容如下,其中包含注释:
--------------------------------------------------------------------------------------------

#源定义
source mysql
{
&#160;&#160; &#160;type&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;= mysql

&#160;&#160;&#160; # 数据库服务器基本配置信息
&#160;&#160;&#160; sql_host&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160; = 192.168.0.103
&#160;&#160;&#160; sql_user&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160; = dedev57
&#160;&#160;&#160; sql_pass&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160; = dedecms
&#160;&#160;&#160; sql_db&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160; = dedecmsv57gbk
&#160;&#160;&#160; sql_port&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160; = 3306
&#160;&#160; &#160;
&#160;&#160;&#160; # 设定编码,这里我们是gbk编码,如果是utf-8,可以设置:
&#160;&#160;&#160; # sql_query_pre&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;= SET NAMES utf8
&#160;&#160; &#160;sql_query_pre&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;= SET NAMES gbk
&#160;&#160; &#160;
&#160;&#160; &#160;# 数据检索增量
&#160;&#160;&#160; sql_range_step = 1000
&#160;&#160; &#160;
&#160;&#160;&#160; #当前最新文档id数
&#160;&#160;&#160; sql_query_pre = REPLACE INTO dede_sphinx SELECT 1, MAX(id) FROM dede_archives
&#160;&#160; &#160;
&#160;&#160;&#160; #检索条件
&#160;&#160;&#160; sql_query&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160; = SELECT ARC.id,ARC.typeid,ARC.typeid2,ARC.sortrank,ARC.flag,ARC.channel,ARC.ismake,ARC.arcrank,ARC.click,ARC.title,ARC.shorttitle,ARC.color,ARC.writer,ARC.source,ARC.litpic,ARC.pubdate,ARC.senddate,ARC.mtype,ARC.description,ARC.badpost,ARC.goodpost,ARC.scores,ARC.lastpost,ARC.keywords,ARC.mid,ART.body FROM dede_archives AS ARC LEFT JOIN dede_addonarticle AS ART ON ARC.id = ART.aid WHERE ARC.id>=$start AND ARC.id<=$end #sql_query第一列id需为整数
&#160;&#160;&#160; #title、body作为字符串/文本字段,被全文索引
&#160;&#160; &#160;
&#160;&#160;&#160; # 获取当前最大检索id
&#160;&#160;&#160; sql_query_range&#160; = SELECT 1,maxaid FROM dede_sphinx WHERE countid=1

&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;
&#160;&#160; &#160;sql_attr_uint&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160; = typeid&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;#从SQL读取到的值必须为整数
&#160;&#160;&#160; sql_attr_uint&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160; = typeid2
&#160;&#160;&#160; sql_attr_uint&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160; = channel
&#160;&#160;&#160; sql_attr_uint&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160; = click
&#160;&#160;&#160; sql_attr_uint&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160; = badpost
&#160;&#160;&#160; sql_attr_uint&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160; = goodpost
&#160;&#160;&#160; sql_attr_uint&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160; = scores
&#160;&#160;&#160; sql_attr_uint&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160; = mid
&#160;&#160;&#160; sql_attr_timestamp&#160; = pubdate&#160;&#160;&#160; #从SQL读取到的值必须为整数,作为时间属性
&#160;&#160;&#160; sql_attr_timestamp&#160; = senddate
&#160;&#160;&#160; sql_attr_timestamp&#160; = lastpost

&#160;&#160;&#160; #命令行查询时,从数据库读取原始数据信息
&#160;&#160; &#160;sql_query_info&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;= SELECT ARC.*,ART.body FROM dede_archives AS ARC LEFT JOIN dede_addonarticle AS ART ON ARC.id = ART.aid WHERE ARC.id=$id &#160;
}

source delta
{
&#160;&#160; &#160;type&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;= mysql

&#160;&#160;&#160; # 数据库服务器基本配置信息
&#160;&#160;&#160; sql_host&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160; = 192.168.0.103
&#160;&#160;&#160; sql_user&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160; = dedev57
&#160;&#160;&#160; sql_pass&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160; = dedecms
&#160;&#160;&#160; sql_db&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160; = dedecmsv57gbk
&#160;&#160;&#160; sql_port&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160; = 3306
&#160;&#160; &#160;sql_query_pre&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;= SET NAMES gbk

&#160;&#160;&#160; # 增量索引,从最大id开始
&#160;&#160;&#160; sql_query = SELECT ARC.id,ARC.typeid,ARC.typeid2,ARC.sortrank,ARC.flag,ARC.channel,ARC.ismake,ARC.arcrank,ARC.click,ARC.title,ARC.shorttitle,ARC.color,ARC.writer,ARC.source,ARC.litpic,ARC.pubdate,ARC.senddate,ARC.mtype,ARC.description,ARC.badpost,ARC.goodpost,ARC.scores,ARC.lastpost,ARC.keywords,ARC.mid,ART.body FROM dede_archives AS ARC LEFT JOIN dede_addonarticle AS ART ON ARC.id = ART.aid WHERE ARC.id > ( SELECT maxaid FROM dede_sphinx WHERE countid=1 )
&#160;&#160;&#160; #从SQL读取到的值必须为整数
&#160;&#160; &#160;
&#160;&#160;&#160; sql_query_post = REPLACE INTO dede_sphinx SELECT 1, MAX(id) FROM dede_archives
&#160;&#160; &#160;
&#160;&#160; &#160;sql_attr_uint&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160; = typeid&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;
&#160;&#160;&#160; sql_attr_uint&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160; = typeid2
&#160;&#160;&#160; sql_attr_uint&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160; = channel
&#160;&#160;&#160; sql_attr_uint&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160; = click
&#160;&#160;&#160; sql_attr_uint&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160; = badpost
&#160;&#160;&#160; sql_attr_uint&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160; = goodpost
&#160;&#160;&#160; sql_attr_uint&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160; = scores
&#160;&#160;&#160; sql_attr_uint&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160; = mid
&#160;&#160;&#160; sql_attr_timestamp&#160; = pubdate&#160;&#160;&#160; #从SQL读取到的值必须为整数,作为时间属性
&#160;&#160;&#160; sql_attr_timestamp&#160; = senddate
&#160;&#160;&#160; sql_attr_timestamp&#160; = lastpost

&#160;&#160;&#160; #命令行查询时,从数据库读取原始数据信息
&#160;&#160; &#160;sql_query_info&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;= SELECT ARC.*,ART.body FROM dede_archives AS ARC LEFT JOIN dede_addonarticle AS ART ON ARC.id = ART.aid WHERE ARC.id=$id &#160;
}


#index定义
index mysql
{
&#160;&#160; &#160;source&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;= mysql&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160; #对应的source名称
&#160;&#160; &#160;path&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;= D:/coreseek-3.2.13-win32/var/data/mysql
&#160;&#160; &#160;docinfo&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;= extern
&#160;&#160; &#160;mlock&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;= 0
&#160;&#160; &#160;morphology&#160;&#160; &#160;&#160;&#160; &#160;= none
&#160;&#160; &#160;min_word_len&#160;&#160; &#160;&#160;&#160; &#160;= 1
&#160;&#160; &#160;html_strip&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;= 0
&#160;&#160; &#160;#charset_dictpath = /usr/local/mmseg3/etc/&#160;&#160; &#160;#BSD、Linux环境下设置,/符号结尾
&#160;&#160; &#160;charset_dictpath = D:/coreseek-3.2.13-win32/etc/&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;#Windows环境下设置,/符号结尾
&#160;&#160; &#160;charset_type&#160;&#160; &#160;&#160;&#160; &#160;= zh_cn.gbk
}

index delta : mysql
{
&#160;&#160;&#160; min_word_len&#160;&#160; &#160;&#160;&#160; &#160;= 1
&#160;&#160;&#160; source = delta
&#160;&#160; &#160;path&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;= D:/coreseek-3.2.13-win32/var/data/delta.new
}


#全局index定义
indexer
{
&#160;&#160; &#160;mem_limit&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;= 128M
}

#searchd服务定义
searchd
{
&#160;&#160;&#160; listen&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160; =&#160;&#160; 9312
&#160;&#160; &#160;read_timeout&#160;&#160; &#160;&#160;&#160; &#160;= 5
&#160;&#160; &#160;max_children&#160;&#160; &#160;&#160;&#160; &#160;= 30
&#160;&#160; &#160;max_matches&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;= 1000
&#160;&#160; &#160;seamless_rotate&#160;&#160; &#160;&#160;&#160; &#160;= 0
&#160;&#160; &#160;preopen_indexes&#160;&#160; &#160;&#160;&#160; &#160;= 0
&#160;&#160; &#160;unlink_old&#160;&#160; &#160;&#160;&#160; &#160;&#160;&#160; &#160;= 1
&#160;&#160; &#160;pid_file = D:/coreseek-3.2.13-win32/var/log/searchd_mysql.pid
&#160;&#160; &#160;log = D:/coreseek-3.2.13-win32/var/log/searchd_mysql.log
&#160;&#160; &#160;query_log = D:/coreseek-3.2.13-win32/var/log/query_mysql.log
}


-------------------------------------------------------------------------------------------------------

1.3.建立索引
配置完成后,我们要先建立索引,在开始菜单中打开[运行],输入&quot;cmd&quot;,确认后打开命令行.输入下列代码:

d:&cd D:coreseek-3.2.13-win32bin

先切换到sphinx的bin目录,然后再执行:

indexer.exe -c D:coreseek-3.2.13-win32etccsft_dedecmsv57.conf mysql --rotate

这个时候sphinx开始构建索引,如果数据量比较大,这个时间可能比较长,需要耐心等待(如图1).

=700) window.open('http://bbs.dedecms.com/attachment/44_11787_d17cacd281863bf.gif?12');"style="max-width:700px;max-height:700px;"  >图片:DedeCMS V5.7全文检索使用说明-1.gif





然后再创建下增量索引,使用下列命令:
indexer.exe -c D:coreseek-3.2.13-win32etccsft_dedecmsv57.conf delta --rotate


1.4.测试检索是否正常
建立完索引之后我们来检测下是否能够正常搜索到匹配内容,可以继续在cmd中输入下列命令:

search.exe -c D:coreseek-3.2.13-win32etccsft_dedecmsv57.conf dedecms

如果能够正常返回数据(如图2),则说明已经成功建立索引.

=700) window.open('http://bbs.dedecms.com/attachment/44_11787_f994601f86afd50.gif?12');"style="max-width:700px;max-height:700px;"  >图片:DedeCMS V5.7全文检索使用说明-2.gif





2.结合DedeCMS程序使用sphinx
2.1.开启sphinx服务
在上面的步骤中我们已经成功生成了索引,接下来为了能够使用客户端调用则需要开启sphinx服务.
可以直接在cmd中执行:
searchd.exe -c D:coreseek-3.2.13-win32etccsft_dedecmsv57.conf
这样我们就开启了sphinx服务(如图3),我们可以写一个简单的例子进行测试:

=700) window.open('http://bbs.dedecms.com/attachment/44_11787_29ff75dbef5c2b2.gif?6');"style="max-width:700px;max-height:700px;"  >图片:DedeCMS V5.7全文检索使用说明-3.gif





sphinx_test.php
--------------------------------------------------------------------------------------------------------
<?php
set_time_limit(0);
require_once (dirname(__FILE__) . &quot;/include/common.inc.php&quot;);
$sphinx = new SphinxClient;

$mode = SPH_MATCH_ANY;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160; //匹配模式
$host = &quot;localhost&quot;;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160;&#160; //服务ip
$port = 9312;&#160;&#160;&#160; //服务端口
&#160;&#160;&#160;&#160;&#160;&#160; &#160;
$sphinx->SetServer($host, $port);
$sphinx->SetArrayResult(true);
$sphinx->SetMatchMode($mode);

$res = $sphinx->Query(&#39;织梦内容管理系统&#39;);

//var_dump($sphinx);
//var_dump($res);
$total = count($res[&#39;matches&#39;]);
for($i=0; $i < $total; $i++)
{
&#160;&#160;&#160; var_dump($res[&#39;matches&#39;][$i]);
}

-----------------------------------------------------------------------------------------------------
执行sphinx_test.php,可以看到已经能够正常通信,并且返回了内容.

=700) window.open('http://bbs.dedecms.com/attachment/44_11787_fe5ef48234e3084.gif?11');"style="max-width:700px;max-height:700px;"  >图片:DedeCMS V5.7全文检索使用说明-4.gif





2.2.创建一个DedeSphinx服务
上面我们通过searchd.exe开启了服务,但不好的是,我们关闭了cmd窗口就不能继续访问了,解决办法如下:
同样切换到bin目录下,执行:

searchd.exe --install -c D:coreseek-3.2.13-win32etccsft_dedecmsv57.conf --servicename DedeSphinx
这样就在系统中成功创建了一个DedeSphinx服务,无需再打开窗口(如图5).

=700) window.open('http://bbs.dedecms.com/attachment/44_11787_2d98a98c11f2499.gif?22');"style="max-width:700px;max-height:700px;"  >图片:DedeCMS V5.7全文检索使用说明-5.gif





3.更新与维护
对于全文检索的索引,我们是需要不定期生成的,如果是数据量比较小,直接使用上述生成索引的命令重建就可以,如果数据量比较大,我们则需要定义的更新全文索引.

如果内容更新比较频繁,下列的命令需要每分钟被执行一次(可以创建一个脚本,使用windows计划任务定期执行)

生成增量索引:

indexer.exe -c D:coreseek-3.2.13-win32etccsft_dedecmsv57.conf delta --rotate

当然每一天都需要将增量索引合并到主索引mysql中去,需要执行:

indexer.exe -c D:coreseek-3.2.13-win32etccsft_dedecmsv57.conf --merge mysql delta --rotate

[ 此帖被天涯在2011-03-08 14:39重新编辑 ]

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

x
回复 支持 反对

使用道具 举报

发表于 2011-3-8 11:04:42 | 显示全部楼层
期盼已久的织梦DedeCMS v5.7正式版终于发布了,功能更为强大了,前来支持。....
织梦管理员之家(http://www.dedeadmin.com)还是会一如既往的提供dedecms 5.7最新使用技巧和帮助教程,发布更多支持dedecms5.7的模板与插件,感谢大家一直以来的支持。
[ 此帖被依忻在2011-03-08 20:58重新编辑 ]
回复 支持 反对

使用道具 举报

发表于 2011-3-8 11:05:04 | 显示全部楼层
看了半天,是什么意思呢


如果是 两个 或 三个 DEDECMS 站

是不是可以把内容全搜索出来的意思?


是不是等于小型搜索引擎~~~

求解[ 此帖被xiaoc3在2011-03-08 18:13重新编辑 ]
回复 支持 反对

使用道具 举报

发表于 2011-3-8 11:05:16 | 显示全部楼层
全文检索  用户体验将更上一层楼
回复 支持 反对

使用道具 举报

发表于 2011-3-8 11:05:16 | 显示全部楼层
杯具。。。看不懂,学学先
回复 支持 反对

使用道具 举报

发表于 2011-3-8 11:05:40 | 显示全部楼层
占楼,在看
回复 支持 反对

使用道具 举报

发表于 2011-3-8 11:06:03 | 显示全部楼层
顶完慢慢看……
回复 支持 反对

使用道具 举报

发表于 2011-3-8 11:06:12 | 显示全部楼层
没看懂
回复 支持 反对

使用道具 举报

发表于 2011-3-8 11:06:13 | 显示全部楼层
DedeCMS V5.7   我要留名
回复 支持 反对

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

小黑屋|手机版|Archiver|网站之家技术交流论坛 ( 粤ICP备09092995号 )

GMT+8, 2024-12-22 11:50 , Processed in 0.095498 second(s), 6 queries , File On.

Powered by Discuz! X3.4

© 2001-2023 Discuz! Team.

快速回复 返回顶部 返回列表