使用Spark批量上传图片到HBase中并同时使用OpenCV提取SIFT特征值

最新推荐文章于 2024-07-13 07:15:00 发布

原创

最新推荐文章于 2024-07-13 07:15:00 发布 · 5k 阅读

13 ·

CC 4.0 BY-SA版权

本文介绍了如何使用Spark进行图像数据的批量上传到HBase，并在上传过程中利用OpenCV提取SIFT特征值。通过将上传和提取过程合并，减少了序列化和磁盘IO的时间消耗。在实验中遇到了包括数据元素数量不匹配、任务不可序列化、OpenCV库加载失败以及Mat类型不兼容等错误，通过调整代码和配置解决了这些问题。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

最近正在学习利用Spark做图像的分类和检索实验，首先需要上传图像数据（保存在本地文件系统中）到HBase中，提取的图像特征是SIFT，借助OpenCV库提取，刚开始是写一个任务上传图片，然后再写一个任务提取HBase中图像的特征值，考虑到图片的序列化和反序列化会耗费大量的时间，且频繁的磁盘IO对时间消耗也很大，因此，将两个任务合并成一个任务处理，减少处理时间，同时实验过程中也遇到不少错误。

批量上传数据并提取SIFT特征

package com.fang.spark

import java.awt.image.{BufferedImage, DataBufferByte}
import java.io.ByteArrayInputStream
import javax.imageio.ImageIO
import org.apache.hadoop.hbase._
import org.apache.hadoop.hbase.client._
import org.apache.hadoop.hbase.util.Bytes
import org.apache.spark.{SparkConf, SparkContext}
import org.opencv.core.{Core, CvType, Mat, MatOfKeyPoint}
import org.opencv.features2d.{DescriptorExtractor, FeatureDetector}

/**
  * Created by hadoop on 16-11-15.
  * 批量上传数据到HBase表中，并计算sift值
  * 表结构为：
  * imagesTable：(image:imageBinary，sift)
  * RowKey设计为：
  */

object HBaseUpLoadImages {
   
   
  def main(args: Array[String]): Unit = {
    val sparkConf = new SparkConf()
      .setAppName("HBaseUpLoadImages").
      setMaster("local[4]").
      set("spark.serializer", "org.apache.spark.serializer.KryoSerializer"</