音视频多媒体

文本提示与提示图会话复用;跨图片样例特征缓存;正例、负例样例复核;三层多尺度特征匹配;全图与重叠切片推理;密集目标重复框融合;单图与批量接口;内部置信度和候选来源诊断。
320Python人工智能
咨询威Q【3447764415】新盛-腾龙博安-三家已合并【新盛官网—xs10692.com】【腾龙官网—TL12581.com】。华纳自上世纪50年代成立以来,生产的庐山牌云雾茶多次获得国内外金奖,蝉联历届中国名茶的称号。并且是庐山区第一个建厂的国营茶厂单位,如今是庐山云雾茶的重要产区,共拥有山林
340C++企业服务
主要以接入不同厂商及不同协议监控摄像头为主,ipc和nvr。并且主要实现功能有下面5个点:1.直播拉流,2视频回放,3.智能算法监控包含了(吸烟,无人,人流统计)4.摄像头ptz操控,5.不同上下游厂商设备及联推送和拉取,视频回放包含(本地sd卡及云存储)。对接客户包括:toG有:昌平公安/长沙交通
450C音视频多媒体
1.多模态角色身份识别模块:针对同人异名等痛点,系统融合了人脸、字幕、音频、视频等多模态信息。通过设计人脸过滤、聚类及跨集Embedding去重策略,实现了全剧“一人一名”的精准映射,说话人标注准确率高达95%。2.多角色智能翻译与Agent改稿模块:构建了说话人感知、语种规则与术语约束的翻译策略,
280Torch人工智能
系统支持自然语言任务解析、国家与人群画像约束、RAG知识检索、脚本与镜头规划、外部素材检索、TTS口播、字幕及背景音乐合成、成片质检、人工审核、多账号多平台发布。发布后可定时抓取评论,分析咨询意向,生成建议回复并推送高意向线索。配套FastAPI与Vue控制台,提供账号、任务、发布记录、上传素材、学
690Python人工智能
功能包含素材上传与资产选择、数字人视频轨道、时间轴编排、语义智能切片、行业与时长设置、切片节奏控制、画面氛围与贴纸背景、滤镜、转场、音效、字幕样式、节奏点、预览、封面生成和一键成片。用户可先保存草稿,再调整画面比例、节奏和视觉效果后统一输出。
440Vue人工智能
主要功能包括爆款素材检索、AI文案改写、文字转语音与声音选择、数字人形象选择及上传、口型同步、背景和画面比例设置、素材自动切片与混编、视频预览、一键成片、草稿保存和资产管理。用户可按步骤完成从主题或文案到口播视频的完整生产流程,并在生成前预览关键参数,减少重复操作。
540Python人工智能
项目包含剧本结构化、角色与场景设定、分镜及提示词生成、镜头素材管理、对白音频处理、字幕时间轴生成、人物口型同步、视频裁剪拼接、音画对齐和质量检查等模块。支持按镜头配置视频与音频素材,批量执行推理任务并输出中间结果;通过自动化脚本统一分辨率、帧率和音频参数,最终生成带字幕的竖屏短剧成片,同时保留剧本、
870Python人工智能
1、本项目使用了传统人工算法和ai模型相辅相成,既保留了传统算法的高效运行速度又享受了机器学习(AI)算法的领先的处理效果2、本算法使用了ai补帧技术,即使是实心不透明的水印也能正常去除3、模型部署在fastapi框架下的后端服务器上,具有用户注册,充值,登陆,余额管理等功能4、用户通过安卓客户端或
600C++人工智能
项目分为三大功能模块:1.门户内容展示模块:支持广电新闻、节目预告、行业公告的分类展示与搜索浏览;2.动态权限管控模块:基于岗位、部门、操作角色实时计算可访问资源,自动调整用户栏目访问、内容编辑、素材上传权限,规避固定权限漏洞;3.后台运营管理模块:管理员可新增/下架内容、管理人员账号、查看操作日志
840Python工业互联网
提供主播素材管理、任务队列、参考视频分析、风格配方、脚本与导演规划、Agnes视频生成、IndexTTS分段配音、HeyGem或Duix口型同步、候选质检、最终复核、包装与多平台发布计划。只读看板从真实运行目录汇总任务和产物,发布步骤必须显式批准。
1030Python人工智能
提供素材新增、修改、删除和列表查询接口;MySQL数据同步至Qdrant;支持全量索引重建;按文案执行向量检索并结合多标签过滤;提供健康检查、OpenAPI文档和DockerCompose一键启动。冒烟测试覆盖CRUD、中文检索、标签筛选、同步与删除完整闭环。
860Python人工智能
VisionChord是一套AI驱动的虚拟吉他伴奏系统,主要包含用户输入分析、音乐特征提取、智能伴奏生成以及实时交互模块。系统能够根据用户输入的音乐信息进行分析,并生成匹配的虚拟吉他伴奏效果,实现辅助创作和音乐练习功能。项目结合人工智能算法与音频处理技术,构建从输入理解到音乐输出的完整流程。系统设计
520Python人工智能
1.系列剧本管理:多集剧本+角色库+场景库,支持集数导航与版本切换;2.剧本编辑器:分镜、对白、旁白、镜头提示词一站式编辑,支持协作批注;3.多平台AI视频生成:无缝对接国内主流视频生成API(可灵/即梦/混元/Vidu/Seedance等),同一剧本可生成多风格视频素材;4.画布流编排:拖拽式视频
930Python人工智能
●系统架构设计:主导构建模块化Agent架构,集成视频理解、行为分析、画像建模与LLM决策四大模块,支持实时流式处理与批量更新,系统日均处理视频50W+,用户行为日志2亿+条。●多模态:基于Qwen-VL实现视频帧语义分类,准确率达91.3%(Top-1);融合YOLOv8(目标检测)、Whispe
1230Python人工智能
项目定位:用户一句话描述主题,AI自动从长视频中裁剪跑题/废话/停顿段落,输出主题相关短视频片段。全程本地处理,不上传云端。GitHub开源MIT,中英文README+PRD文档。1、功能模块:6步管线——Step1意图提取(NL→视频路径+主题+强度)、Step2Whisper转字幕、Step2.
1320Python人工智能
onnx-wakeword开源项目
1、项目有哪些具体功能模块跨平台推理适配模块、五层防误唤醒检测模块、模型加载解析模块、音频梅尔频谱转换模块、多唤醒词并行识别模块。2、项目的主要功能描述支持加载各类框架导出的ONNX唤醒词模型,内置五层独立可控防误触发检测逻辑,搭配倍率、阈值、置信度可视化调节;一套代码兼容ESP32、Android
1720Python人工智能
它可以量化“拍得好不好”,主要分析以下关键指标(KPI):·清晰度(Sharpness/MTF):这是最核心的功能。通过斜边测试卡精确计算镜头分辨率,评估图像边缘锐度。·色彩与噪点:测试色彩还原准确度(ΔE值),以及分析暗光下的信噪比(SNR)和动态范围。·镜头畸变与均匀性:分析广角镜头导致的畸变(
850Python开发工具
系统由三大引擎构成:1)TTS引擎,包含文本前端(分词/TN/韵律分析)、BERT+LSTM韵律预测、混合语言G2P转换、声学模型与声码器,支持中英混文本,提供流式/非流式gRPC+WebSocket双接口;2)Talking-Face引擎,基于单张图片+语音生成带声视频;3)AvatarEdito
870C++人工智能
构建了一套多情绪/风格合成系统。成功实现对相声大师刘宝瑞音色的高保真克隆,并应用于《官场斗》续集文本的自动化语音生成。续集大概有30集,每集20分钟。推出后得到了广泛好评。
1410Python音视频多媒体
当前共30个项目more
×
寻找源码
源码描述
联系方式
提交