Hugging Face Blog·· 2023-02-15AI 评分43
使用 BLIP-2 实现零样本图像到文本生成
Zero-shot image-to-text generation with BLIP-2
AI 导读
Salesforce Research 发布的 BLIP-2 模型现已集成至 Hugging Face Transformers,支持图像描述、提示词图像描述、视觉问答及基于聊天的提示。该模型通过轻量级 Q-Former 桥接视觉与语言模型,仅需微调该组件即可利用冻结的预训练视觉编码器和 LLM,显著降低训练成本。
来源:Hugging Face Blog · huggingface.co