ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

[1214]基于Python实现视频去重

[1214]基于Python实现视频去重 文章目录videohash2️ 安装 基本用法 比较视频如何判断相似 进阶用法⚠️ 使用限制 与另一个分支的区别基于Python实现视频去重基本原理实现方法其它视频去重codevideohash2https://github.com/akamhy/videohashhttps://github.com/Demmenie/videohash2在开始之前请确保你的电脑已经安装了FFmpeg这是它正常工作的基础。️ 安装最推荐的方式是通过 pip 从 PyPI 安装pipinstallvideohash2如果安装失败可以尝试加上--prefer-binary选项。 基本用法videohash2的核心是VideoHash类。它可以处理本地视频文件路径或网络URL比如YouTube链接。fromvideohash2importVideoHash# 1. 从URL创建哈希video_hash_1VideoHash(urlhttps://example.com/video.mp4)# 2. 从本地文件路径创建哈希video_hash_2VideoHash(path/path/to/your/local/video.mp4) 比较视频如何判断相似这是它的核心功能。你可以计算两个视频哈希值的“距离”来判断相似度距离越小视频越相似。# 假设 video_hash_1 和 video_hash_2 已经创建好# 方法一计算“海明距离” (Hamming Distance)# 计算两个哈希值有多少位不同结果为整数0表示完全一致distancevideo_hash_1-video_hash_2print(f视频间的距离是:{distance})# 方法二使用内置的相似度判断# 返回 True 或 False内部使用了一个默认的阈值来判断是否相似is_similarvideo_hash_1.is_similar(video_hash_2)print(f两个视频是否相似:{is_similar})# 你还可以直接用 判断是否完全一致is_identical(video_hash_1video_hash_2)print(f两个视频是否完全一致:{is_identical}) 进阶用法调整采样帧率通过frame_interval参数控制每秒提取多少帧数值越大计算越精确但耗时也更长。默认是每秒1帧。# 每5秒提取1帧 (0.2 fps)video_hashVideoHash(pathvideo.mp4,frame_interval0.2)# 每秒提取5帧 (5 fps)video_hashVideoHash(pathvideo.mp4,frame_interval5)管理临时文件VideoHash在计算过程中会下载视频或创建临时文件可以通过storage_path指定存放目录防止撑爆系统临时文件夹。video_hashVideoHash(url...,storage_path/my/big/drive/video_cache)# 处理完后可以手动调用删除临时文件video_hash.delete_storage_path()⚠️ 使用限制这个工具的设计目标并不是视频指纹识别所以有一些场景它不适用它不能判断一个视频是否是另一个视频的一部分。如果视频被反转播放或旋转了超过10度哈希值可能会发生较大变化导致无法识别为相似视频。 与另一个分支的区别搜索时你可能还会看到一个叫videohash(不带2) 的库它是videohash2的前身。videohash2是最新版修复了旧版的一些问题建议直接使用videohash2。基于Python实现视频去重基本原理一款基于Python语言的视频去重复程序它可以根据视频的特征参数将重复的视频剔除以减少视频的存储空间。它的基本原理是首先利用Python语言对视频文件进行解析提取视频的特征参数如帧率、码率等然后根据特征参数生成视频的哈希值最后将每个视频的哈希值进行对比如果哈希值相同则表示视频内容相同可以将其中一个视频剔除以节省存储空间。实现方法基于Python实现视频去重小工具需要使用Python语言的一些第三方库如OpenCV、PIL等。实现的基本步骤如下1、首先使用OpenCV库对视频文件进行解析提取视频的特征参数2、然后使用PIL库将视频的每一帧转换为灰度图片计算每一帧图片的哈希值3、最后将每个视频的哈希值进行对比如果哈希值相同则表示视频内容相同可以将其中一个视频剔除。示例代码import cv2 from PIL import Image # 读取视频文件 video_file video.mp4 cap cv2.VideoCapture(video_file) # 提取视频的特征参数 frame_rate cap.get(cv2.CAP_PROP_FPS) frame_width cap.get(cv2.CAP_PROP_FRAME_WIDTH) frame_height cap.get(cv2.CAP_PROP_FRAME_HEIGHT) # 计算每一帧图片的哈希值 while True: # 读取每一帧图片 success, frame cap.read() if not success: break # 将图片转换为灰度图 gray_frame cv2.cvtColor(frame, cv2.COLOR_BGR2GRAY) # 计算图片的哈希值 image Image.fromarray(gray_frame) hash_value image.hash() # 将哈希值进行对比如果哈希值相同则表示视频内容相同 if hash_value other_hash_value: # 剔除重复视频 pass # 释放视频文件 cap.release()其它视频去重code同级目录下新建dup_video# -*- coding:utf-8 -*- import json import os import shutil import cv2 import imagehash from PIL import Image from loguru import logger from PySimpleGUI import popup_get_folder class VideoDuplicate(object): 返回整个视频的图片指纹列表 从1秒开始每3秒抽帧计算一张图像指纹 def __init__(self): self._over_length_video: list [] self._no_video: list [] def _video_hash(self, video_path) - list: param video_path - 视频绝对路径; hash_arr [] cap cv2.VideoCapture(video_path) ##打开视频文件 logger.info(f开始抽帧【{video_path}】) n_frames int(cap.get(cv2.CAP_PROP_FRAME_COUNT)) # 视频的帧数 logger.warning(f视频帧数:{n_frames}) fps cap.get(cv2.CAP_PROP_FPS) # 视频的帧率 logger.warning(f视频帧率:{fps}) dur n_frames / fps * 1000 # 视频大致总长度 cap_set 1000 logger.warning(f视频大约总长:{dur / 1000}) if dur // 1000 11: logger.error(f视频时长超出规定范围【6~10】;当前时长:【{dur // 1000}】;跳过该视频;) self._over_length_video.append(video_path) return [] while cap_set dur: # 从3秒开始每60秒抽帧计算图像指纹。总长度-3s是因为有的时候计算出来的长度不准。 cap.set(cv2.CAP_PROP_POS_MSEC, cap_set) logger.debug(f开始提取:【{cap_set // 1000}】/s的图片;) # 返回该时间点的图像(numpy数组)及读取是否成功 success, image_np cap.read() if success: img Image.fromarray(cv2.cvtColor(image_np, cv2.COLOR_BGR2RGB)) # 转成cv图像格式 h str(imagehash.dhash(img)) logger.success(f【{cap_set}/s图像指纹:【{h}】) hash_arr.append(h) # 图像指纹 else: logger.error(str(cap_set / 1000)) cap_set 1000 * 2 cap.release() # 释放视频 return hash_arr def start(self, base_dir): param base_dir - 主文件路径; data: list [] for video in os.listdir(base_dir): logger.debug(f- * 80) name, ext os.path.splitext(video) if ext not in (.mp4, .MP4): logger.error(f视频文件格式不符;【{video}】;执行跳过;) continue abs_video_path os.path.join(base_dir, video) video_hash_list self._video_hash(abs_video_path) if video_hash_list: data.append({video_abs_path: abs_video_path, hash: video_hash_list}) self._write_log(data) return data staticmethod def _write_log(data: list) - None: 视频哈希后的值写入日志文件 with open(flog.txt, w, encodingutf-8) as f: f.write(json.dumps(data)) def __call__(self, base_dir, *args, **kwargs): self.start(base_dir) logger.debug(f-----------------------------------开始比对关键帧差值感知余弦算法-----------------------------) with open(log.txt) as f: data json.loads(f.read()) for i in range(0, len(data) - 1): for j in range(i 1, len(data)): if data[i][hash] data[j][hash]: _, filename os.path.split(data[i][video_abs_path]) logger.error(f移动文件:【{filename}】) shutil.move( os.path.join(base_dir, filename), os.path.join(os.path.join(os.getcwd(), dup_video), filename) ) logger.warning(---------------------超长视频----------------------) for i in self._over_length_video: _, name os.path.split(i) logger.error(name) def main(): path popup_get_folder(请选择[视频去重]文件夹) v VideoDuplicate() v(path) if __name__ __main__: main()参考https://blog.csdn.net/weixin_44634704/article/details/128563576https://fiime.cn/blog/202363
返回列表