在线工具大全

用多模态技术在多媒体系统中实现场景分类

出处： mp.weixin.qq.com 作者：多媒体

视频场景分类算法是计算机视觉领域研究的热门内容，并作为复杂任务系统的前置算法，能够应用于我们多媒体实验室多项业务，如内容自适应转码、画质智能修复和视频质量评估（VQA）中。通过针对不同类型的图像自适应抉择不同的模型，从而精准有效提升算法在业务中的实际效果。语言、视觉是人类感知世界最基本的方法，也是人工智能理解世界的两大支柱。多模态是结合了图像、文本、音频等多种数据类型的一种技术方案。该技术不仅提高了模型的泛化能力，还扩展了人工智能技术的应用方向，如图像分类、图像问答、文本图像生成等。本文研究了多模态算法在多媒体系统中进行场景分类的应用，探讨了实施过程中的挑战并给出对应的解决方案。

哔哩哔哩技术

查看原文

39 技术 lddgo 分享于 2024-08-27

简体中文