---
id: 20260924-T0-10
title: "Ovis-Embedding：统一文本图像视频音频的全模态嵌入模型"
title_en: "Ovis-Embedding: Universal Omni-Modal Embeddings for Text, Image, Video, and Audio"
url: https://ai.daily.yangsir.net/daily/20260924-T0-10
issue_date: 2026-09-24
publish_date: 2026-09-23T04:00:00.000Z
category: research
source_name: "arXiv cs.AI"
source_url: https://arxiv.org/abs/2609.25165
---

# Ovis-Embedding：统一文本图像视频音频的全模态嵌入模型

arXiv论文发布Ovis-Embedding，一种全模态嵌入模型，原生整合文本、图像、视频和音频四种模态。与拼接独立模态塔的方案不同，Ovis-Embedding采用共享多模态骨干网络，在统一嵌入空间中表示不同模态。论文编号arXiv:2609.25165v1，属cs.AI方向。

## English Version

**Ovis-Embedding: Universal Omni-Modal Embeddings for Text, Image, Video, and Audio**

A new arXiv paper introduces Ovis-Embedding, a state-of-the-art omni-modal embedding family that natively integrates text, image, video, and audio. Unlike approaches that assemble separate modality towers, Ovis-Embedding uses a shared multimodal backbone to represent all modalities in a unified embedding space. Paper ID: arXiv:2609.25165v1, under cs.AI.

---

**来源**：[arXiv cs.AI](https://arxiv.org/abs/2609.25165)

**详情页**：https://ai.daily.yangsir.net/daily/20260924-T0-10

---

*智语观潮 · Daily — https://ai.daily.yangsir.net/llms.txt*