{/* This page is auto-generated from the skill's SKILL.md by website/scripts/generate-skill-docs.py. Edit the source SKILL.md, not this page. */}

Llava

大型语言与视觉助手。支持视觉指令微调（instruction tuning）和基于图像的对话。将 CLIP 视觉编码器与 Vicuna/LLaMA 语言模型相结合。支持多轮图像对话、视觉问答（VQA）和指令跟随。适用于视觉语言聊天机器人或图像理解任务。最适合对话式图像分析。

Skill 元数据


来源	可选 — 通过 `hermes skills install official/mlops/llava` 安装
路径	`optional-skills/mlops/llava`
版本	`1.0.0`
作者	Orchestra Research
许可证	MIT
依赖项	`transformers`, `torch`, `pillow`
平台	linux, macos, windows
标签	`LLaVA`, `Vision-Language`, `Multimodal`, `Visual Question Answering`, `Image Chat`, `CLIP`, `Vicuna`, `Conversational AI`, `Instruction Tuning`, `VQA`

参考：完整 SKILL.md

信息

以下是 Hermes 在触发该 skill 时加载的完整 skill 定义。这是 skill 激活时 agent 所看到的指令内容。

LLaVA - 大型语言与视觉助手

用于对话式图像理解的开源视觉语言模型。

何时使用 LLaVA

适用场景：

构建视觉语言聊天机器人

视觉问答（VQA）

图像描述与字幕生成

多轮图像对话

视觉指令跟随

含图像的文档理解

指标：

GitHub 23,000+ 星标

GPT-4V 级别能力（目标）

Apache 2.0 许可证

多种模型规格（7B–34B 参数）

改用其他方案的情况：

GPT-4V：质量最高，基于 API

CLIP：简单零样本分类

BLIP-2：更适合纯字幕生成

Flamingo：研究用途，非开源

快速开始

安装

基本用法

可用模型

模型	参数量	显存	质量
LLaVA-v1.5-7B	7B	~14 GB	良好
LLaVA-v1.5-13B	13B	~28 GB	较好
LLaVA-v1.6-34B	34B	~70 GB	最佳

CLI 用法

Web UI（Gradio）

多轮对话

常见任务

图像字幕生成

视觉问答

目标检测（文本形式）

场景理解

文档理解

训练自定义模型

量化（降低显存占用）

最佳实践

从 7B 模型开始 — 质量良好，显存需求可控

使用 4-bit 量化 — 显著降低显存占用

需要 GPU — CPU 推理极慢

清晰的 prompt — 具体问题能获得更好的答案

多轮对话 — 保持对话上下文

温度 0.2–0.7 — 平衡创造性与一致性

max_new_tokens 512–1024 — 用于详细回复

批量处理 — 按顺序处理多张图像

性能

模型	显存（FP16）	显存（4-bit）	速度（tokens/s）
7B	~14 GB	~4 GB	~20
13B	~28 GB	~8 GB	~12
34B	~70 GB	~18 GB	~5

在 A100 GPU 上测试

基准测试

LLaVA 在以下基准上取得了有竞争力的分数：

VQAv2：78.5%

GQA：62.0%

MM-Vet：35.4%

MMBench：64.3%

局限性

幻觉 — 可能描述图像中不存在的内容

空间推理 — 难以精确定位位置

小字体文本 — 难以识别细小字体

目标计数 — 对大量目标计数不精确

显存需求 — 需要高性能 GPU

推理速度 — 比 CLIP 慢

与框架集成

LangChain

Gradio 应用

资源

GitHub：https://github.com/haotian-liu/LLaVA ⭐ 23,000+

论文：https://arxiv.org/abs/2304.08485

演示：https://llava.hliu.cc

模型：https://huggingface.co/liuhaotian

许可证：Apache 2.0

"Llava — 大型语言与视觉助手"

Llava#

Skill 元数据#

参考：完整 SKILL.md#

LLaVA - 大型语言与视觉助手#

何时使用 LLaVA#

快速开始#

安装#

基本用法#

可用模型#

CLI 用法#

Web UI（Gradio）#

多轮对话#

常见任务#

图像字幕生成#

视觉问答#

目标检测（文本形式）#

场景理解#

文档理解#

训练自定义模型#

量化（降低显存占用）#

最佳实践#

性能#

基准测试#

局限性#

与框架集成#

LangChain#

Gradio 应用#

资源#

Llava

Skill 元数据

参考：完整 SKILL.md

LLaVA - 大型语言与视觉助手

何时使用 LLaVA

快速开始

安装

基本用法

可用模型

CLI 用法

Web UI（Gradio）

多轮对话

常见任务

图像字幕生成

视觉问答

目标检测（文本形式）

场景理解

文档理解

训练自定义模型

量化（降低显存占用）

最佳实践

性能

基准测试

局限性

与框架集成

LangChain

Gradio 应用

资源