全文索引操作

本文介绍了在 SQL Server 2005 及以上版本中使用 CONTAINS 和 FREETEXT 谓词进行全文检索的方法,并通过实例展示了如何查询特定词汇、变形词、前缀词、加权词及邻近词。
在sqlserver2005及以上编写全文索引,若要进行全文查询,有四个关键字可选。

CONTAINS 和 FREETEXT 谓词只能在 SELECT 语句的 WHERE 子句中使用。

CONTAINSTABLE 和 FREETEXTTABLE 行集值函数可以在 SELECT 语句的 FROM 子句中使用。

CONTAINS用于查询特定的词或者短语,有以下几种情形:

一个或多个特定的单词和/或短语;特定词的变形(派生词);特定单词的同义词形式(同义词库);以指定文本开头的词或短语(前缀词);使用加权值的词或短语(加权词);与另一个词或短语邻近的词或短语(邻近词)。
以下以SQLSERVER2008联机丛书的例子,说明上面几种用法。

1:查询特定的词或者短语
 
USE AdventureWorks;
GO
SELECT Comments
FROM Production.ProductReview
WHERE CONTAINS(Comments, ' "learning curve" ');
GO
此查询用于将comments列中含有learning curve的都查出来。

全文搜索查询不区分大小写。但一般还是要注意规范。

2:特定词的变形,如drive的drives,drvoen。。

USE AdventureWorks;
GO
SELECT Comments, ReviewerName
FROM Production.ProductReview
WHERE CONTAINS (Comments, 'FORMSOF(INFLECTIONAL, "foot")');
GO

全文搜索使用词干分析器。词干分析器可以搜索某个动词的不同时态,或者某个名词的单数和复数形式。

3:以指定文本开头的词或短语(前缀词)

USE AdventureWorks;
GO
SELECT Description, ProductDescriptionID
FROM Production.ProductDescription
WHERE CONTAINS (Description, ' "top*" ' );
GO
将含有top开头的所有词都查出来,别忘记了双引号。

4:使用加权值的词或短语(加权词)

使用加权值的意思是,每个所需要查询的词的重要性不同,权重范围从0到1,权重越大的词越优先返回。

USE AdventureWorks
GO
SELECT AddressLine1, KEY_TBL.RANK
FROM Person.Address AS Address INNER JOIN
CONTAINSTABLE(Person.Address, AddressLine1, 'ISABOUT ("Bay*",
         Street WEIGHT(0.9),
         View WEIGHT(0.1)
         ) ' ) AS KEY_TBL
ON Address.AddressID = KEY_TBL.[KEY]
ORDER BY KEY_TBL.RANK
GO

STREET的权重是0.9,所以会优先返回。这里注意使用的是CONTAINSTABLE行基函数,所以它只能用在from字句中,CONTAINSTABLE ,FREETEXTSTABLE这两个行基函数都返回两个值,一个是key,一个是RANK。key指定了返回表中的标识列,RANK则表明返回的次序,RANK值越大,表明匹配程度越高。在这段代码里,可以设定返回的行数,如只返回10行,那么会大大优化全文搜索的性能。

5:与另一个词或短语邻近的词或短语(邻近词)

USE AdventureWorks;
GO
SELECT DocumentID, DocumentSummary, Document
FROM Production.Document AS DocTable INNER JOIN
CONTAINSTABLE(Production.Document, Document, '(Reflector NEAR Bracket)' ) AS KEY_TBL
ON DocTable.DocumentID = KEY_TBL.[KEY]
ORDER BY KEY_TBL.RANK;
GO

会返回含有Reflector 与 Bracket相近的行。near左右无顺序区别,可以用~代替。

 

 

一、数据采集层:多源人脸数据获取 该层负责从不同设备 / 渠道采集人脸原始数据,为后续模型训练与识别提供基础样本,核心功能包括: 1. 多设备适配采集 实时摄像头采集: 调用计算机内置摄像头(或外接 USB 摄像头),通过OpenCV的VideoCapture接口实时捕获视频流,支持手动触发 “拍照”(按指定快捷键如Space)或自动定时采集(如每 2 秒采集 1 张),采集时自动框选人脸区域(通过Haar级联分类器初步定位),确保样本聚焦人脸。 支持采集参数配置:可设置采集分辨率(如 640×480、1280×720)、图像格式(JPG/PNG)、单用户采集数量(如默认采集 20 张,确保样本多样性),采集过程中实时显示 “已采集数量 / 目标数量”,避免样本不足。 本地图像 / 视频导入: 支持批量导入本地人脸图像文件(支持 JPG、PNG、BMP 格式),自动过滤非图像文件;导入视频文件(MP4、AVI 格式)时,可按 “固定帧间隔”(如每 10 帧提取 1 张图像)或 “手动选择帧” 提取人脸样本,适用于无实时摄像头场景。 数据集对接: 支持接入公开人脸数据集(如 LFW、ORL),通过预设脚本自动读取数据集目录结构(按 “用户 ID - 样本图像” 分类),快速构建训练样本库,无需手动采集,降低系统开发与测试成本。 2. 采集过程辅助功能 人脸有效性校验:采集时通过OpenCV的Haar级联分类器(或MTCNN轻量级模型)实时检测图像中是否包含人脸,若未检测到人脸(如遮挡、侧脸角度过大),则弹窗提示 “未识别到人脸,请调整姿态”,避免无效样本存入。 样本标签管理:采集时需为每个样本绑定 “用户标签”(如姓名、ID 号),支持手动输入标签或从 Excel 名单批量导入标签(按 “标签 - 采集数量” 对应),采集完成后自动按 “标签 - 序号” 命名文件(如 “张三
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值