free-vision-skill

agent
Guvenlik Denetimi
Uyari
Health Uyari
  • License — License: MIT
  • Description — Repository has a description
  • Active repo — Last push 0 days ago
  • Low visibility — Only 9 GitHub stars
Code Gecti
  • Code scan — Scanned 12 files during light audit, no dangerous patterns found
Permissions Gecti
  • Permissions — No dangerous permissions requested

Bu listing icin henuz AI raporu yok.

SUMMARY

A low-token visual evidence compiler for text-only coding agents. Convert images into compact Visual Evidence Packets (VEP) for DeepSeek, Codex, Claude Code, and other text-only models.

README.md

Free Vision Skill 👁️

给没有视觉能力的模型,装上一双按需调用的眼睛。
A low-token visual evidence compiler for text-only coding agents.

MIT License
Node 20+
VEP/1 Protocol
Text-Only Agents
v0.4.1
CI/CD
30/30 Tests


Free Vision Skill: 将图片压缩为 VEP 证据包(50-150 tokens),让文本模型也能看见

🎯 为什么需要它?

问题: DeepSeek-V4-Flash、Claude Code CLI 等文本模型无法直接读取图片,但经常需要分析截图、UI、图表等视觉内容。

传统方案: 把图片交给视觉模型,生成 2000-5000 tokens 的长描述 → 主模型处理

  • ❌ Token 消耗高
  • ❌ 无关描述多
  • ❌ 上下文污染
  • ❌ 视觉模型越权推理

Free Vision Skill 的方案:

graph LR
    A[图片] --> B[视觉提取]
    B --> C[VEP/1 证据包]
    C --> D[主模型推理]
    style C fill:#7ee787,color:#07090c
    style D fill:#0d1116,color:#e6edf3

核心价值:

  • 90-95% Token 节省(50-150 tokens vs 2000-5000)
  • 视觉模型只负责看见,主模型继续负责思考
  • 强制触发检测 — 模型无法读图时自动触发,不再误诊为"图片损坏"

⚡ 快速开始

安装

# 方式 1:推荐(npx + skills CLI)
npx skills add lora-sys/free-vision-skill

# 方式 2:npm 全局安装
npm install -g free-vision-skill

# 方式 3:克隆运行
git clone https://github.com/lora-sys/free-vision-skill.git
cd free-vision-skill && npm install

配置

# 中国用户
echo "ZHIPU_API_KEY=你的key" >> .env
echo "VISION_PROVIDER=auto" >> .env
echo "VISION_REGION=cn" >> .env

# 全球用户
echo "OPENROUTER_API_KEY=你的key" >> .env
echo "VISION_PROVIDER=auto" >> .env
echo "VISION_REGION=global" >> .env

详细配置: 配置指南

使用

# 基础用法
free-vision see --image ./error.png --question "只提取错误信息和行号"

# 指定 Provider
free-vision see --image ./chart.png --provider openrouter --question "返回图表标题和三个关键值"

# 自动裁剪(减少图片大小 50-90%)
free-vision see --image ./screenshot.png --auto-crop --question "提取 UI 问题"

# JSON 输出(用于解析)
free-vision see --image ./invoice.png --json --question "提取发票金额和日期"

更多用例: 使用场景指南


🎬 效果演示

Token 对比

Token 对比:传统方案 2000-5000 tokens vs Free Vision Skill 50-150 tokens,节省 90-95%

VEP 输出示例

VEP/1 协议格式和字段说明示例

字段说明:

  • src — Provider 和模型
  • m — 任务模式(error / ocr / ui / chart)
  • a — 直接答案
  • t — OCR 文本
  • e — 可见错误
  • c — 置信度(0-1)

详细协议: VEP 规范


✨ 核心特性

特性 说明
🎯 极低 Token 50-150 tokens,比完整描述节省 90-95%
性能优化 智能缓存 + 并发控制,健康检查 32.5x 更快
🔐 安全存储 macOS Keychain + Linux Secret Service + Windows Credential Manager
🌍 13 个 Provider 国内 4 + 全球 9,自动降级
🚨 强制触发检测 模型无法读图时自动触发,不再误诊为"图片损坏"
✂️ 智能裁剪 自动检测边距,减少 50-90% 图片大小

详细文档: 核心特性详解


🌍 支持的 Provider

🇨🇳 中国优先

Provider 模型 免费额度
Zhipu glm-4.6v-flash 永久免费
ModelScope Qwen/Qwen3-VL-8B-Instruct 变化
SiliconFlow 配置模型 变化
Alibaba qwen3-vl-flash 新用户 90 天

🌍 全球

Provider 模型 免费额度
OpenRouter nvidia/nemotron-nano-12b-v2-vl:free 永久免费
Groq qwen/qwen3.6-27b 免费计划
Gemini gemini-3.5-flash-lite 免费层
Mistral mistral-small-latest Studio Free
Ollama qwen3-vl:235b-cloud 轻量免费

完整列表: Provider 指南


🧪 测试状态

测试项 结果
总体 30/30 测试通过
TypeScript 类型检查 ✅ 通过
单元测试 ✅ 5 个文件,30 个测试
构建 ✅ 成功
CI/CD GitHub Actions 绿色通过

详细测试报告: 测试状态


📖 文档导航

🚀 快速上手

💡 核心文档

🛠️ 集成

🔒 安全与性能

📋 开发


🤝 贡献

欢迎提交:

  • ✅ 新 Provider(需官方文档)
  • ✅ VEP 压缩改进
  • ✅ 本地模型支持(Ollama 等)
  • ✅ Windows Keychain 支持

不接受:

  • ❌ 匿名代理或逆向工程 API
  • ❌ 无官方文档的 Provider

详见 贡献指南


📄 License

MIT © 2026 lora-sys

详见 LICENSE


🙏 致谢

感谢以下开源视觉模型和 API 提供商:
智谱 AI · 阿里 ModelScope · OpenRouter · Groq · Google Gemini · Mistral AI · Cohere · Cloudflare Workers AI · Ollama · SambaNova · NVIDIA NIM


先看见,再压缩,再推理。 👁️

Free Vision Skill · low-token visual evidence compiler

⭐ Star · 🐛 Issues · 🤝 Contribute

Yorumlar (0)

Sonuc bulunamadi