音视频多媒体

基于Wav2Lip模型开发的音频驱动数字人唇形同步工具,输入单张人物图片与语音音频,即可自动生成口型与音频精准匹配的数字人说话视频,人物眉眼、头部等其余面部区域保持自然静态,适用于短视频制作、数字人播报、课程配音、虚拟解说等场景。1.核心算法:基于GAN生成对抗网络架构,通过提取音频梅尔频谱特征驱动
360Python开发工具
SHOTWISE是一款开源、自托管的AI视频生产工作台,面向AI漫剧/短剧、小说说书和广告带货短视频等场景。用户只需导入小说、成品剧本或商品素材,系统即可通过多智能体编排完成内容分析、角色与场景提取、分集规划、结构化剧本、分镜生成、旁白与视频片段制作,并进一步合成成片或导出剪映草稿。项目提供角色、场
1060Python人工智能
体育直播开源项目
该项目主要是短视频和主播直播为主的各类视频娱乐项目,提供各类视频,短视频,直播视频提供视频为主的资源。功能主要有:短视频播放,直播间,送礼物,聊天,视频推荐和搜索,关注等功能
540Android音视频多媒体
视频平台开源项目
多屏预览:支持1/4/6/9/12/16/25屏自由切换,满足各种监控场景✅分屏控制:一键清空、保存布局、恢复布局、全屏模式✅智能云台:上下左右方向控制、变倍、聚焦、光圈调节、预置位巡航✅语音对讲:双向语音对讲,支持单路音频开关✅截图抓拍:实时画面快照保存✅多码流切换:普清、高清、超清三档码流自由切
640Java音视频多媒体
提供多画布分页、文本/图片/视频/音频/分镜节点、拖拽连线、分组、缩放和小地图。创作助手支持候选剧本、镜头与提示词拆解及视频时间点分析,草稿可编辑后加入画布。支持模型目录与参数配置、异步媒体任务、进度状态、素材检索、媒体预览和下载;视频处理模块提供FFmpeg合并与转场。项目支持本地保存、服务器版本
1870React人工智能
Zeno是面向影视特效制作的开源物理仿真与渲染引擎,通过节点图组织计算流程,支持流体、刚体、弹塑性材料及流固耦合仿真,并提供几何处理、实时预览和光线追踪渲染。相关仿真特效曾用于《流浪地球2》和杭州亚运会开幕式。我于2020年12月至2024年1月担任创始成员及核心研发工程师,主导节点图执行引擎、数据
790C++音视频多媒体
magnet-to-strm开源项目
1.通过115离线下载解析磁力链接,生成.strm文件,并记录磁链信息和115文件信息。2.访问strm时,若115网盘中目标文件仍存在,则直接使用,若不存在,则自动重新离线后使用。3.从而使用极小的磁盘空间和较小的115容量即可管理超大规模的影视库。4.对外暴露Aria2和qBittorrent兼
690Docker音视频多媒体
1.核心逻辑层(core/)watermark_core.py:定义水印参数数据类(WatermarkParams),封装水印位置、大小、旋转角、透明度、颜色等属性;提供核心渲染函数apply_watermark,将水印参数与源图片结合,生成最终输出图像(支持JPEG格式)。font_manager
950Python开发工具
这是一个**AI音乐处理Web应用**,用户上传音频后,系统自动完成端到端处理:1.**6轨音源分离**-用Demucs`htdemucs_6s`模型分离vocals/drums/bass/piano/guitar/other2.**乐器识别与MIDI转录**-对other轨二次分类(piano/g
970Python音视频多媒体
Mineradio_WEB端开源项目
Mineradio_web是一款Windows网页沉浸式音乐播放器,把搜索播放、歌词舞台、粒子视觉、3D歌单架和完整桌面模式组合成一个更接近现场感的私人音乐空间。
7860webview音视频多媒体
面向短视频创作的智能AIGC系统。核心功能模块包括:1.样例视频解析:上传爆款样例视频后,系统通过ffprobe提取元数据、PySceneDetect识别镜头节奏、Whisper提取语音脚本,自动生成VideoDNA结构化数据2.结构迁移引擎:将样例的脚本线索、镜头节奏和素材槽位抽象为统一的Vide
1200Python音视频多媒体
live2dpet开源项目
一款基于Live2DCubism的AI桌面宠物系统的项目,采用Python+PySide6,构建无边框透明桌面窗口,支持鼠标追踪、眼球动画与拖拽交互。核心能力包括:集成多厂商LLM(OpenAI/DeepSeek/Ollama等),实现流式对话与情感标签提取;对接GPT-SoVITS,完成实时语音合
3100Python人工智能
Vibe Videoing开源项目
VibeVideoing是面向智能视频生产的专业编辑器。Agent可协同完成脚本拆解、素材生成、动画编排、代码迭代与渲染验证;创作者则通过多轨时间线、场景分组、参数面板和画布交互进行精细调整,实现代码能力与专业级图形化剪辑体验的无缝结合。
860HTML5人工智能
冰雹开源项目
核心展示:循环轮播展示图文素材,支持批量新增、编辑、删除幻灯片;2.无障碍适配:所有图片必填alt描述文本,满足网站合规要求;3.交互控制:开启/关闭自动轮播、设置滑动动画时长、自定义切换方向;4.数据兼容:支持备用素材地址(alt备用资源),主素材加载失败自动切换备用资源;5.响应式适配:电脑、手
620CSS音视频多媒体
本项目是一款基于PHP8.1+的可视化抖音作品解析与本地下载工具,支持抖音短链、视频页、图文页及完整分享口令。解析过程通过NDJSON流式展示实时进度,可识别多种页面数据并自动切换回退策略。视频结果支持按清晰度、分辨率以及H.264、H.265、AV1编码选择无水印MP4;图文作品支持原图预览,并将
1990PHP开发工具
limit-music开源项目
1.依托Electron打造可多终端联动的本地音乐播放器,以Vite-Vue搭建现代化前端,结合Node.js、SQLite构建轻量化本地后台;2.打通多类控制通路,本地客户端、远程网页、外部接口均可跨端操控播放器;3.支持后台静默播放,深度对接Windows系统媒体控制模块;内置歌词智能解析匹配引
790SQLite音视频多媒体
软件介绍CyberVerse是一个开源的实时数字人Agent框架。我做这个项目时,一直想解决一个很具体的问题:数字人不应该只停留在“生成一段视频”或“播放一个虚拟形象”的阶段。更有意思的是你打开一个界面,选择一个角色,给它配置声音、人设、记忆和模型,然后它真的可以开始和你说话,可以被打断,可以接着聊
2320Python人工智能
项目定位:用户一句话描述主题,AI自动从长视频中裁剪跑题/废话/停顿段落,输出主题相关短视频片段。全程本地处理,不上传云端。GitHub开源MIT,中英文README+PRD文档。1、功能模块:6步管线——Step1意图提取(NL→视频路径+主题+强度)、Step2Whisper转字幕、Step2.
1510Python人工智能
浏览、搜索、排序本地视频目录。按目录、标签、收藏组织视频,支持多标签交集筛选。使用FFmpeg生成缩略图。缓存视频时长、分辨率、编码等元数据,并使用扫描索引加快再次打开视频库。使用mpv播放常见桌面视频格式。支持深色/亮色主题。支持手机端扫码绑定电脑。手机端可在局域网内浏览电脑视频库。手机端提供沉浸
1220JavaScript音视频多媒体
onnx-wakeword开源项目
1、项目有哪些具体功能模块跨平台推理适配模块、五层防误唤醒检测模块、模型加载解析模块、音频梅尔频谱转换模块、多唤醒词并行识别模块。2、项目的主要功能描述支持加载各类框架导出的ONNX唤醒词模型,内置五层独立可控防误触发检测逻辑,搭配倍率、阈值、置信度可视化调节;一套代码兼容ESP32、Android
2040Python人工智能
当前共460个项目more
×
寻找源码
源码描述
联系方式
提交