# 视觉问答
视觉问答
Phi 4 Multimodal Instruct
优质新品
Phi-4-multimodal-instruct 是微软开发的多模态基础模型,支持文本、图像和音频输入,生成文本输出。
AI模型#语音识别开源
1,080
Smolvlm 500M Instruct
SmolVLM-500M 是由 Hugging Face 开发的轻量级多模态模型,属于 SmolVLM 系列。
AI模型#图像描述开源
552
Omagent.com
OmAgent是一个多模态原生代理框架,用于智能设备等。
智能体#智能设备
396
Paligemma2 3b Pt 224
PaliGemma 2是由Google开发的视觉-语言模型,它结合了SigLIP视觉模型和Gemma 2语言模型的能力,能够处理图像和文本输入,并生成相应的文本输出。
AI模型#多语言支持开源
408
Paligemma2 3b Pt 448
PaliGemma 2是一个由Google开发的视觉-语言模型,继承了Gemma 2模型的能力,能够处理图像和文本输入并生成文本输出。
AI模型#多语言支持开源
396
Internvl2 5 26B MPO
InternVL2_5-26B-MPO是一个多模态大型语言模型(MLLM),它在InternVL2.5的基础上,通过混合偏好优化(Mixed Preference Optimization, MPO)进一步提升了模型性能。
AI模型#大型语言模型开源
684
Internvl2 5 1B MPO
InternVL2_5-1B-MPO是一个多模态大型语言模型(MLLM),它基于InternVL2.5和混合偏好优化(MPO)构建,展示了优越的整体性能。
AI模型#大型语言模型开源
804
Deepseek VL2 Small
DeepSeek-VL2是一系列先进的大型混合专家(MoE)视觉语言模型,相较于前代DeepSeek-VL有显著提升。
AI模型#光学字符识别开源
720
Deepseek VL2
DeepSeek-VL2是一系列大型Mixture-of-Experts视觉语言模型,相较于前代DeepSeek-VL有显著提升。
AI模型#多模态理解开源
2,316
Pixtral 12B 2409
Pixtral-12B-2409是由Mistral AI团队开发的多模态模型,包含12B参数的多模态解码器和400M参数的视觉编码器。
AI图像生成#图像处理开源
348
Videollama2 7B
VideoLLaMA2-7B是由DAMO-NLP-SG团队开发的多模态大型语言模型,专注于视频内容的理解和生成。
AI视频生成#语言模型开源
1,632
Videollama2 7B Base
VideoLLaMA2-7B-Base 是由 DAMO-NLP-SG 开发的大型视频语言模型,专注于视频内容的理解与生成。
AI视频生成#多模态学习开源
1,812
Idefics 80b
HuggingFaceM4/idefics-80b-instruct是一个开源的多模态模型,它可以接受图像和文本的输入,输出相关的文本内容。
AI模型#多模态开源
1,068
Kosmos 2
Kosmos-2是一个多模态大型语言模型,可以将自然语言与图像、视频等多种形式的输入进行关联。
AI模型#多模态开源
792
SEED
SEED是一个大规模预训练的模型,通过对交错的文本和视觉数据进行预训练和指导调整,展现了在广泛的多模态理解和生成任务上的出色性能。
AI模型#多模态开源
1,020