Communitygithub.com

farhanic017/vision-tool

Ferramenta de análise de imagem e vídeo para assistentes de codificação AI que não possuem visão nativa. Funciona com qualquer modelo, seja como CLI, MCP ou skill opencode.

O que é vision-tool?

O farhanic017/vision-tool é uma habilidade versátil que permite que assistentes de codificação AI (como Claude Code, Cursor, Codex, etc.) realizem análise de imagens e vídeos, mesmo sem suporte nativo a visão. Ele funciona com qualquer modelo e pode ser utilizado via interface de linha de comando (CLI), protocolo MCP (Model Context Protocol) ou como skill do opencode. A ferramenta oferece suporte a 12 backends de visão, incluindo Gemini, GPT-4o, Claude e outros, garantindo ampla compatibilidade. Um dos principais diferenciais é a segurança: nenhum segredo (API keys, tokens) é codificado diretamente no arquivo, utilizando variáveis de ambiente ou métodos seguros de configuração. Isso torna a habilidade ideal para equipes que precisam de análise visual em seus fluxos de desenvolvimento de software sem comprometer a segurança ou a flexibilidade de escolha do modelo AI subjacente.

Funciona comClaude Code~Codex CLI~CursorGemini CLIOpenCode
npx skills add farhanic017/vision-tool

Perguntar na sua IA favorita

Abre um novo chat com esta habilidade de agente já pré-carregada.

Documentação

O que vision-tool faz?

Image & video analysis for AI coding assistants without native vision. Works with any model - CLI, MCP, or opencode skill. 12 vision backends (Gemini, GPT-4o, Claude, etc.). Zero hardcoded secrets.

Habilidades Relacionadas