让Deepseek教我用AI辅助看没字幕的xx动作片??

原创 嵌入式软件实战派 2025-02-21 12:01

之前在某宝上买了两个拆机硬盘,这个文章(我在二手硬盘里发现了一堆不可描述的内容)有描述其中的内,后来觉得很鸡肋,然后送我朋友了。

没多久,那家伙吞吞吐吐问我那个硬盘坏了能不能修复,我搞不明白他对硬盘塞了什么不可描述的内容,导致其承受不了崩了,我在这个文章(《一块不可描述的硬盘坏了,又不好意思去修……》)讲了这个事情的经过。

最后,反正我没修好,也不知道他对硬盘干了啥。他知道我没帮他修好硬盘,将大腿都拍烂了。

又过了段时间,他找我唠叨,说看片没字幕,很好奇里面是啥剧情。我跟他说网上一大堆字幕网站,很容易找到影片对应的字幕文件的。

他说找不到的,真的找不到,然后又在叹气,说好不容易下了几个4K HDR的片子,画面贼溜,就是缺了字幕,很是遗憾。

我还在纳闷啥玩意呢,听他这么说似乎瞬间又明白他看得是啥片子了。

我一下子也不知道怎么搞,直接跟他说:要不你学学这门外语?你之前为了批量爬取这些信息把Python都啃下了,这对你来说还不是“湿湿碎”?!

他没理我,过一会他突发奇想,说最近Deepseek很火,能不能用AI帮忙搞搞?辅助看片 or 提取字幕?

咦?对于身为程序员且颇有好奇心的我,为啥不试试呢?我对不可描述技术研究可是很感兴趣的。

用AI辅助看片?我以前真没想过这种操作!

AI同声传译

于是我发挥我的想象力,把手机摆在电脑旁边,开着AI实时语音翻译或同声传译功能?

但是,这样也能解决问题,但总觉得怪怪的。

在线音频提取文字

于是乎,从网上搜提取字幕的工具或方法,但是经验告诉我:别用度娘,浪费时间浪费精力!

呵呵,广告!在线提取……

这里提个醒,不要将不可描述的内容上传到网上哈,不然分分钟被警察叔叔找你喝茶都不知道怎么回事。

然后呢,好像都不尽如意!

Whisper

不是说用AI辅助看片吗,这事肯定问AI啊。

于是我问好几个AI(中间结果我就不展示了),最终发现还是鼎鼎大名的Deepseek给我的答案靠谱点。

他贴心地告诉我,提取字幕的方法分两类:提取内嵌字幕和通过语言识别生成字幕。而且,还给我做了个总结。

他不知道我问这个问题是想用AI帮忙看片哈,第一种方法是不适用的,我想要的是第二种。

看名字,好像Whisper很厉害的样子,窃窃私语都能懂。

接着,我从OpenAI的官网找到这个Whisper。

Whisper是一个自动语音识别系统,它是在从网络上收集的 68 万小时的多语言、多任务监督数据上进行训练的。

然后,看这配图,不觉明历!

ASR Summary Of Model Architecture

表面上的原理很简单,它是一个end-to-end模型,实现一个encoder-decoder的转换,输入的音频会被切片成30秒的小块,然后就巴拉巴拉……

Diagram detailing how ASR models are trained

好吧,这原理我看不懂,反正觉得它应该搞得定。

怎么玩呢?

首先要安装whisper,如果用Python的话,还要安装PyTorch

pip install -U openai-whisper

或者

pip install git+https://github.com/openai/whisper.git 

然后下载模型包。注意,这是AI模型来的,所以要下载人家训练好的模型来使用。这里有6种模型,存在性能和准确度的差异,以下官方提供了个表做对比:

Size
Parameters
English-only model
Multilingual model
Required VRAM
Relative speed
tiny
39 M
tiny.entiny
~1 GB
~10x
base
74 M
base.enbase
~1 GB
~7x
small
244 M
small.ensmall
~2 GB
~4x
medium
769 M
medium.enmedium
~5 GB
~2x
large
1550 M
N/A
large
~10 GB
1x
turbo
809 M
N/A
turbo
~6 GB
~8x

你不知道用哪个,都下几个来试试。

这不用说,肯定是越大就越精确,但是就运行效率越低,那你就根据你的电脑性能来选咯。

在哪下载模型呢?

在huggingface.co上可以下载,但是要技术上网,你懂的。如果你不懂,继续往下看,还有方法解决。

还有另一种,就是找国内的镜像了,例如gitee上面就能找到(https://gitee.com/organizations/hf-models/projects)。

好了,那怎么用呢?

import whisper# 加载模型model = whisper.load_model("large - v2")# 转录音频文件result = model.transcribe("path_to_your_audio_file.wav")# 打印识别结果print(result["text"])

就这样,简单吧。

还有命令行方式的

whisper audio.flac audio.mp3 audio.wav --model turbo

当然也可以指定语言的,例如Japanese

whisper japanese.wav --language Japanese

此时,你提取的文字是日文的哦,看得懂当我没说,不行的话就去翻译吧(这一步简单,我就不啰嗦了)。

然后把字幕扔到播放器就可以愉快地看片了

你还可以通过--help查看相关参数使用。

whisper --help

但是,还是有点麻烦啊。

PotPlayer+Whisper

PotPlayer 241212 版本新增了使用 Whisper 从语音生成字幕的功能,用PotPlayer播放视频可实现识别音频为字幕的功能。

步骤:

  1. 右键打开菜单

  2. 点击“字幕”

  3. 点击“创建有声字幕”

  4. 点击“创建有声字幕……”

然后再打开的对话框里选择参数

这里看一眼就懂了,注意这里这个“型号”就是大模型的名称,例如图中的medium表示faster-whisper-medium模型。

如果你的电脑配置牛逼,你可以选large-v3,这个模型的精确度高很多,当然你要提前下载好这些模型。

完了吗?

Potplayer还给你提供自动翻译的途径。就是这里哈

你可以点击上面的“实时字幕翻译设置……”

这个不难,有兴趣的同学你自己研究吧。

好了,好了。方法有了,软件也装好了,片呢?

我朋友不肯给我片子啊!

回头翻了下前面几个文章,我也不知道,为什么这几篇文章的阅读量那么高,而且比其他的高得离谱。是不是很多人对这个“不可描述”感兴趣,还是平台热度问题。

要是我这个文章超过100个赞,老子豁出去了,将我朋友摁在地上,开个专栏,让他写那个“学Python”的经过,你懂的!

更多内容,请关注“嵌入式软件实战派”!

看完别走,记得点赞、点关注啊!

图片

相关文章>>>

一块不可描述的硬盘坏了,又不好意思去修……

我在二手硬盘里发现了一堆不可描述的内容


嵌入式软件实战派 专注嵌入式软件开发领域知识传授,包括C语言精粹,RTOS原理与使用,MCU驱动开发,AUTOSAR搭建,软件架构方法设计等。
评论 (0)
  • 六西格玛首先是作为一个量度质量水平的指标,它代表了近乎完美的质量的水平。如果你每天都吃一个苹果,有一间水果店的老板跟你说,他们所卖的苹果,质量达到六西格玛水平,换言之,他们每卖一百万个苹果,只会有3.4个是坏的。你算了一下,发现你如果要从这个店里买到一个坏苹果,需要805年。你会还会选择其他店吗?首先发明六西格玛这个词的人——比尔·史密斯(Bill Smith)他是摩托罗拉(Motorloa)的工程师,在追求这个近乎完美的质量水平的时候,发明了一套方法模型,开始时是MAIC,后来慢慢演变成DMA
    优思学院 2025-03-27 11:47 191浏览
  • 在智能终端设备开发中,语音芯片与功放电路的配合直接影响音质表现。广州唯创电子的WTN6、WT588F等系列芯片虽功能强大,但若硬件设计不当,可能导致输出声音模糊、杂音明显。本文将以WTN6与WT588F系列为例,解析音质劣化的常见原因及解决方法,帮助开发者实现清晰纯净的语音输出。一、声音不清晰的典型表现与核心原因当语音芯片输出的音频信号存在以下问题时,需针对性排查:背景杂音:持续的“沙沙”声或高频啸叫,通常由信号干扰或滤波不足导致。语音失真:声音断断续续或含混不清,可能与信号幅度不匹配或功放参数
    广州唯创电子 2025-03-25 09:32 116浏览
  • WT588F02B是广州唯创电子推出的一款高性能语音芯片,广泛应用于智能家电、安防设备、玩具等领域。然而,在实际开发中,用户可能会遇到烧录失败的问题,导致项目进度受阻。本文将从下载连线、文件容量、线路长度三大核心因素出发,深入分析烧录失败的原因并提供系统化的解决方案。一、检查下载器与芯片的物理连接问题表现烧录时提示"连接超时"或"设备未响应",或烧录进度条卡顿后报错。原因解析接口错位:WT588F02B采用SPI/UART双模通信,若下载器引脚定义与芯片引脚未严格对应(如TXD/RXD交叉错误)
    广州唯创电子 2025-03-26 09:05 154浏览
  • 在智慧城市领域中,当一个智慧路灯项目因信号盲区而被迫增设数百个网关时,当一个传感器网络因入网设备数量爆增而导致系统通信失效时,当一个智慧交通系统因基站故障而导致交通瘫痪时,星型网络拓扑与蜂窝网络拓扑在构建广覆盖与高节点数物联网网络时的局限性便愈发凸显,行业内亟需一种更高效、可靠与稳定的组网技术以满足构建智慧城市海量IoT网络节点的需求。星型网络的无线信号覆盖范围高度依赖网关的部署密度,同时单一网关的承载设备数量有限,难以支撑海量IoT网络节点的城市物联系统;而蜂窝网络的无线信号覆盖范围同样高度依
    华普微HOPERF 2025-03-24 17:00 248浏览
  • 汽车导航系统市场及应用环境参照调研机构GII的研究报告中的市场预测,全球汽车导航系统市场预计将于 2030年达到472亿美元的市场规模,而2024年至2030年的年复合成长率则为可观的6.7%。汽车导航系统无疑已成为智能汽车不可或缺的重要功能之一。随着人们在日常生活中对汽车导航功能的日渐依赖,一旦出现定位不准确或地图错误等问题,就可能导致车主开错路线,平白浪费更多行车时间,不仅造成行车不便,甚或可能引发交通事故的发生。有鉴于此,如果想要提供消费者完善的使用者体验,在车辆开发阶段便针对汽车导航功能
    百佳泰测试实验室 2025-03-27 14:51 249浏览
  • 长期以来,智能家居对于大众家庭而言就像空中楼阁一般,华而不实,更有甚者,还将智能家居认定为资本家的营销游戏。商家们举着“智慧家居、智慧办公”的口号,将原本价格亲民、能用几十年的家电器具包装成为了高档商品,而消费者们最终得到的却是家居设备之间缺乏互操作性、不同品牌生态之间互不兼容的碎片化体验。这种早期的生态割裂现象致使消费者们对智能家居兴趣缺失,也造就了“智能家居无用论”的刻板印象。然而,自Matter协议发布之后,“命运的齿轮”开始转动,智能家居中的生态割裂现象与品牌生态之间的隔阂正被基于IP架
    华普微HOPERF 2025-03-27 09:46 158浏览
  • 在当今竞争激烈的工业环境中,效率和响应速度已成为企业制胜的关键。为了满足这一需求,我们隆重推出宏集Panorama COOX,这是Panorama Suite中首款集成的制造执行系统(MES)产品。这一创新产品将Panorama平台升级为全面的工业4.0解决方案,融合了工业SCADA和MES技术的双重优势,帮助企业实现生产效率和运营能力的全面提升。深度融合SCADA与MES,开启工业新纪元宏集Panorama COOX的诞生,源于我们对创新和卓越运营的不懈追求。通过战略性收购法国知名MES领域专
    宏集科技 2025-03-27 13:22 238浏览
  • 案例概况在丹麦哥本哈根,西门子工程师们成功完成了一项高安全设施的数据集成项目。他们利用宏集Cogent DataHub软件,将高安全设施内的设备和仪器与远程监控位置连接起来,让技术人员能够在不违反安全规定、不引入未经授权人员的情况下,远程操作所需设备。突破OPC 服务器的远程连接难题该项目最初看似是一个常规的 OPC 应用:目标是将高安全性设施中的冷水机(chiller)设备及其 OPC DA 服务器,与远程监控站的两套 SCADA 系统(作为 OPC DA 客户端)连接起来。然而,在实际实施过
    宏集科技 2025-03-27 13:20 137浏览
  • ​2025年3月27日​,贞光科技授权代理品牌紫光同芯正式发布新一代汽车安全芯片T97-415E。作为T97-315E的迭代升级产品,该芯片以大容量存储、全球化合规认证、双SPI接口协同为核心突破,直击智能网联汽车"多场景安全并行"与"出口合规"两大行业痛点,助力车企抢占智能驾驶与全球化市场双赛道。行业趋势锚定:三大升级回应智能化浪潮1. 大容量存储:破解车联网多任务瓶颈随着​车机功能泛在化​(数字钥匙、OTA、T-BOX等安全服务集成),传统安全芯片面临存储资源挤占难题。T97-415E创新性
    贞光科技 2025-03-27 13:50 189浏览
  •       知识产权保护对工程师的双向影响      正向的激励,保护了工程师的创新成果与权益,给企业带来了知识产权方面的收益,企业的创新和发明大都是工程师的劳动成果,他们的职务发明应当受到奖励和保护,是企业发展的重要源泉。专利同时也成了工程师职称评定的指标之一,专利体现了工程师的创新能力,在求职、竞聘技术岗位或参与重大项目时,专利证书能显著增强个人竞争力。专利将工程师的创意转化为受法律保护的“无形资产”,避免技术成果被他人抄袭或无偿使
    广州铁金刚 2025-03-25 11:48 187浏览
  • 在智能语音产品的开发过程中,麦克风阵列的选型直接决定了用户体验的优劣。广州唯创电子提供的单麦克风与双麦克风解决方案,为不同场景下的语音交互需求提供了灵活选择。本文将深入解析两种方案的性能差异、适用场景及工程实现要点,为开发者提供系统化的设计决策依据。一、基础参数对比分析维度单麦克风方案双麦克风方案BOM成本¥1.2-2.5元¥4.8-6.5元信噪比(1m)58-62dB65-68dB拾音角度全向360°波束成形±30°功耗8mW@3.3V15mW@3.3V典型响应延迟120ms80ms二、技术原
    广州唯创电子 2025-03-27 09:23 214浏览
  • 在嵌入式语音系统的开发过程中,广州唯创电子推出的WT588系列语音芯片凭借其优异的音质表现和灵活的编程特性,广泛应用于智能终端、工业控制、消费电子等领域。作为该系列芯片的关键状态指示信号,BUSY引脚的设计处理直接影响着系统交互的可靠性和功能拓展性。本文将从电路原理、应用场景、设计策略三个维度,深入解析BUSY引脚的技术特性及其工程实践要点。一、BUSY引脚工作原理与信号特性1.1 电气参数电平标准:输出3.3V TTL电平(与VDD同源)驱动能力:典型值±8mA(可直接驱动LED)响应延迟:语
    广州唯创电子 2025-03-26 09:26 224浏览
  • 在电子设计中,电磁兼容性(EMC)是确保设备既能抵御外部电磁干扰(EMI),又不会对自身或周围环境产生过量电磁辐射的关键。电容器、电感和磁珠作为三大核心元件,通过不同的机制协同作用,有效抑制电磁干扰。以下是其原理和应用场景的详细解析:1. 电容器:高频噪声的“吸尘器”作用原理:电容器通过“通高频、阻低频”的特性,为高频噪声提供低阻抗路径到地,形成滤波效果。例如,在电源和地之间并联电容,可吸收电源中的高频纹波和瞬态干扰。关键应用场景:电源去耦:在IC电源引脚附近放置0.1μF陶瓷电容,滤除数字电路
    时源芯微 2025-03-27 11:19 206浏览
  • 文/陈昊编辑/cc孙聪颖‍2025 年,作为中国实施制造强国战略第一个十年计划的关键里程碑,被赋予了极为重大的意义。两会政府工作报告清晰且坚定地指出,要全力加速新质生产力的发展进程,推动传统产业全方位向高端化、智能化与绿色化转型。基于此,有代表敏锐提议,中国制造应从前沿技术的应用切入,逐步拓展至产业生态的构建,最终延伸到提升用户体验的维度,打出独树一帜、具有鲜明特色的发展牌。正是在这样至关重要的时代背景之下,于 AWE 2025(中国家电及消费电子博览会)这一备受瞩目的舞台上,高端厨房的中国方案
    华尔街科技眼 2025-03-25 16:10 97浏览
  • 家电,在人们的日常生活中扮演着不可或缺的角色,也是提升人们幸福感的重要组成部分,那你了解家电的发展史吗?#70年代结婚流行“四大件”:手表、自行车、缝纫机,收音机,合成“三转一响”。#80年代随着改革开放的深化,中国经济开始飞速发展,黑白电视机、冰箱、洗衣机这“新三件”,成为了人们对生活的新诉求。#90年代彩电、冰箱、全自动洗衣机开始大量进入普通家庭,快速全面普及,90年代末,家电产品实现了从奢侈品到必需品的转变。#00年代至今00年代,随着人们追求高品质生活的愿望,常用的电视机、洗衣机等已经远
    启英AI平台 2025-03-25 14:12 110浏览
我要评论
0
0
点击右上角,分享到朋友圈 我知道啦
请使用浏览器分享功能 我知道啦