# 图像描述

Describe Anything
Describe Anything 模型(DAM)能够处理图像或视频的特定区域,并生成详细描述。
图片生成#视频处理开源
1,176

Aya Vision 32B
Aya Vision 32B 是由 Cohere For AI 开发的先进视觉语言模型,拥有 320 亿参数,支持 23 种语言,包括英语、中文、阿拉伯语等。
AI模型#视觉语言开源
1,104

Aya Vision 8B
CohereForAI的Aya Vision 8B是一个8亿参数的多语言视觉语言模型,专为多种视觉语言任务优化,支持OCR、图像描述、视觉推理、总结、问答等功能。
AI模型#视觉语言模型开源
1,344

MILS
MILS是一个由Facebook Research发布的开源项目,旨在展示大型语言模型(LLMs)在未经过任何训练的情况下,能够处理视觉和听觉任务的能力。
AI模型#多模态开源
564

Smolvlm 500M Instruct
SmolVLM-500M 是由 Hugging Face 开发的轻量级多模态模型,属于 SmolVLM 系列。
AI模型#图像描述开源
552

Paligemma2 3b Pt 224
PaliGemma 2是由Google开发的视觉-语言模型,它结合了SigLIP视觉模型和Gemma 2语言模型的能力,能够处理图像和文本输入,并生成相应的文本输出。
AI模型#多语言支持开源
408

Paligemma2 3b Pt 448
PaliGemma 2是一个由Google开发的视觉-语言模型,继承了Gemma 2模型的能力,能够处理图像和文本输入并生成文本输出。
AI模型#多语言支持开源
396

Internvl2 5 26B MPO
InternVL2_5-26B-MPO是一个多模态大型语言模型(MLLM),它在InternVL2.5的基础上,通过混合偏好优化(Mixed Preference Optimization, MPO)进一步提升了模型性能。
AI模型#大型语言模型开源
684

Internvl2 5 1B MPO
InternVL2_5-1B-MPO是一个多模态大型语言模型(MLLM),它基于InternVL2.5和混合偏好优化(MPO)构建,展示了优越的整体性能。
AI模型#大型语言模型开源
804

Picwordify
PicWordify是一款利用人工智能技术自动为网站图片生成准确描述性文本(alt text)的产品。
SEO优化#SEO
324

AI Describe Pictures
AI Describe Pictures是一个利用人工智能大模型构建的平台,能够快速为图片生成详细或简要的描述。
图片生成#图像描述
1,572

Image Textualization
优质新品
image-textualization 是一个自动框架,用于生成丰富和详细的图像描述。
AI图像检测识别#深度学习开源
780

Hunyuancaptioner
优质新品
HunyuanCaptioner是一款基于LLaVA实现的文本到图像技术模型,能够生成与图像高度一致的文本描述,包括物体描述、物体关系、背景信息、图像风格等。
AI图像生成#文本生成开源
600

Florence 2 Large
Florence-2-large是由微软开发的先进视觉基础模型,采用基于提示的方法处理广泛的视觉和视觉-语言任务。
AI图像生成#多任务学习开源
780

Pixelprose
PixelProse是一个由tomg-group-umd创建的大规模数据集,它利用先进的视觉-语言模型Gemini 1.0 Pro Vision生成了超过1600万个详细的图像描述。
AI图像检测识别#视觉-语言模型开源
744

CLIP Interrogator
Clip Interrogator是一个使用CLIP模型来分析图像并生成描述性文本的工具。
图片编辑#图像描述
996

Idefics 80b
HuggingFaceM4/idefics-80b-instruct是一个开源的多模态模型,它可以接受图像和文本的输入,输出相关的文本内容。
AI模型#多模态开源
1,068

Genalt Generate AI Alternate Text
GenAlt生成在线图像的描述性替代文本,为那些需要的人提供帮助。
AI图像检测识别#图像描述
552

Cogvlm
CogVLM是一个强大的开源视觉语言模型。
AI模型#图像描述开源
2,604

SEED
SEED是一个大规模预训练的模型,通过对交错的文本和视觉数据进行预训练和指导调整,展现了在广泛的多模态理解和生成任务上的出色性能。
AI模型#多模态开源
1,020

Spotbuzz
SpotBuzz是一个使用AI技术为视频和图像生成描述的网页应用。
写作助手#自动生成
1,020

Genalt Generated AI Image Descriptions
GenAlt使用人工智能为没有图像描述的在线图片生成描述性的替代文本!
AI图像检测识别#人工智能
300

ALT AI: Add Alt Text To Image Descriptions
ALT AI: 添加图片描述的Alt文本是一个可访问性工具,可为互联网上的任何页面添加Alt文本。
AI图像检测识别#图像描述
792

Minigpt 4
MiniGPT-4是一个基于先进的大型语言模型的视觉语言理解模型,具有生成详细图像描述、从手写草稿生成网站等功能。
AI图像生成#图像描述开源
336
精选AI产品推荐

Nocode
中文精选
NoCode 是一款无需编程经验的平台,允许用户通过自然语言描述创意并快速生成应用,旨在降低开发门槛,让更多人能实现他们的创意。
开发平台#应用开发
912

Listenhub
优质新品
ListenHub 是一款轻量级的 AI 播客生成工具,支持中文和英语,基于前沿 AI 技术,能够快速生成用户感兴趣的播客内容。
音频生成#AI
348

Lovart
国外精选
Lovart 是一款革命性的 AI 设计代理,能够将创意提示转化为艺术作品,支持从故事板到品牌视觉的多种设计需求。
AI设计工具#创意工具
1,128

Fastvlm
FastVLM 是一种高效的视觉编码模型,专为视觉语言模型设计。
AI模型#图像处理开源
564

Smart PDFs
国外精选
Smart PDFs 是一个在线工具,利用 AI 技术快速分析 PDF 文档,并生成简明扼要的总结。
文章摘要#AI
984

Keysync
KeySync 是一个针对高分辨率视频的无泄漏唇同步框架。
视频编辑#视频处理开源
480

Anyvoice
AnyVoice是一款领先的AI声音生成器,采用先进的深度学习模型,将文本转换为与人类无法区分的自然语音。
音频生成#文本转语音
26.38k

Liblibai
中文精选
LiblibAI是一个中国领先的AI创作平台,提供强大的AI创作能力,帮助创作者实现创意。
AI模型#图像生成
344.42k