OCR
PT-BR | EN
O que e
OCR (Optical Character Recognition) e a tecnologia que extrai texto de imagens — como fotos, prints de tela, documentos digitalizados e PDFs escaneados.
Seu agente consegue ler qualquer texto visivel em imagens e converter para texto editavel.
OCR vs Vision
| Recurso | OCR | Vision |
|---|---|---|
| Foco | Texto puro | Contexto visual completo |
| Extrai | Caracteres, palavras, paragrafos | Descricao de cenas, objetos, pessoas |
| Ideal para | Documentos, notas, placas, codigos | Analise de imagens, perguntas sobre cenas |
| Comando | ocr_image | vision_tool (action=analyze) |
Exemplos Praticos
Extrair Texto de um Print
- Extraia o texto deste screenshot
- Leia o que esta escrito neste print
Documentos Digitalizados
- Extraia o texto deste PDF escaneado
- Leia os dados desta nota fiscal
Placase e Sinalizacao
- Leia o texto desta placa
- Extraia as informacoes do cartaz
Formatos Suportados
| Formato | Extensao | Observacao |
|---|---|---|
| PNG | .png | Ideal para screenshots e graficos |
| JPG | .jpg, .jpeg | Fotos e imagens comprimidas |
| TIFF | .tiff, .tif | Documentos digitalizados de alta qualidade |
| BMP | .bmp | Imagens bitmap sem compressao |
| GIF | .gif | Imagens animadas (le o primeiro frame) |
| Documentos multipagina ou escaneados | ||
| WEBP | .webp | Imagens web modernas |
Dicas para Melhores Resultados
- Use imagens nitidas com boa resolucao
- Garanta bom contraste entre texto e fundo
- Evite fotos tremidas ou com reflexo
- Para documentos escaneados, prefira 300 DPI ou mais
- Texto impresso tem melhor resultado que texto manuscrito
Dica: Combine OCR com Desktop Automation! Primeiro capture a tela (screenshot), depois extraia o texto (ocr_image).
What It Is
OCR (Optical Character Recognition) is the technology that extracts text from images — like photos, screenshots, scanned documents, and PDF files.
Your agent can read any visible text in images and convert it to editable text.
OCR vs Vision
| Feature | OCR | Vision |
|---|---|---|
| Focus | Pure text | Full visual context |
| Extracts | Characters, words, paragraphs | Scene description, objects, people |
| Best for | Documents, notes, signs, codes | Image analysis, questions about scenes |
| Command | ocr_image | vision_tool (action=analyze) |
Practical Examples
Extract Text from a Screenshot
- Extract the text from this screenshot
- Read what is written in this print
Scanned Documents
- Extract text from this scanned PDF
- Read the data from this invoice
Signs
- Read the text on this sign
- Extract the information from the poster
Supported Formats
| Format | Extension | Notes |
|---|---|---|
| PNG | .png | Great for screenshots and graphics |
| JPG | .jpg, .jpeg | Photos and compressed images |
| TIFF | .tiff, .tif | High-quality scanned documents |
| BMP | .bmp | Uncompressed bitmap images |
| GIF | .gif | Animated images (reads first frame) |
| Multi-page or scanned documents | ||
| WEBP | .webp | Modern web images |
Tips for Best Results
- Use sharp images with good resolution
- Ensure good contrast between text and background
- Avoid blurry photos or reflections
- For scanned documents, prefer 300 DPI or higher
- Printed text gives better results than handwriting
Tip: Combine OCR with Desktop Automation! First capture the screen (screenshot), then extract the text (ocr_image).
Agent Appearance — Personalizando o Visual do seu Agente
Português
5 partes que você pode personalizar
️



Como funciona
Dicas de UI/UX
Profissional
Natureza
Tech
English
️ Vision — Analisando e Gerando Imagens com o Agente
Analisar
️ Importante: Extrair texto de imagens (OCR) é uma skill separada — use
️ TTS / Text-to-Speech — Dando Voz ao seu Agente
️ start — Iniciar um agente offline
️ stop — Parar um agente
restart — Reiniciar um agente
swarm_status — Leaderboard do Swarm
Swarm Self-Healing — Keeping Your Swarm Healthy
billing_details — Seu plano e gastos
query-token-usage — Seus tokens em detalhe
offer_extra_credit — Recarregue quando acabar
Gmail
Google Calendar
Google Drive
Billing & Tokens
PDF
DOCX
TXT
Avatar — Foto de perfil do agente
Footer — Rodapé do chat
web-search (padrão): Usa o motor Brave Search — rápido, resultados curados, ideal para o dia a dia
generic-web-search (fallback): Usa SearXNG (metabuscador) — ativado automaticamente se o Brave falhar ou retornar resultados vazios
️ Resumir emails não lidos do dia
Lembretes automáticos baseados no calendário
Use descrições claras — "token X" é melhor que "aquela coisa"
️ Desktop Automation — Controle de Tela, Mouse e Teclado