Murad Library
Murad LibraryREF-0367MD

Guia: Modelos de Rerank para o Dify

Catalogued
Reading
6 min read

Pesquisa feita em junho/2026. Preços e limites de tokens mudam — confirme sempre na página oficial antes de decidir.


Antes de tudo: você precisa mesmo de rerank?

Rerank é opcional no Dify. Seu assistente já funciona sem ele. O rerank é um segundo filtro de busca: depois que o embedding traz, digamos, os 20 trechos mais parecidos com a pergunta, o reranker reordena esses 20 e devolve só os 3–5 realmente mais relevantes. Isso melhora a precisão em bases grandes e bagunçadas.

Para uma base pequena (a sua tem ~263 trechos) o ganho costuma ser modesto. Vale ligar para testar e por boa prática, mas não é o que vai fazer ou quebrar seu chatbot. Não trave o projeto por causa disso.

Fluxo mental: busca ampla (embedding) → reordena estreito (rerank) → manda os melhores pro LLM.


Resumo rápido (o que escolher)

ProvedorGrátis?Custo depoisPortuguêsFacilidadeMelhor para
Jina AISim, tokens grátis na chave nova~US$ 0,02 / 1M tokensÓtimo (multilíngue)★★★★★Começar rápido sem dor de cabeça
Voyage AISim, 200M tokens grátisUS$ 0,02–0,05 / 1M tokensÓtimo (multilíngue)★★★★Melhor free tier + qualidade de ponta
CohereTrial (só teste)US$ 2,00 / 1.000 buscasÓtimo (100+ idiomas)★★★★Padrão de mercado, produção
SiliconFlowCréditos no cadastroMuito barato (centavos)Bom (bge-m3)★★★Custo-benefício ao escalar
bge-reranker (self-host)100% grátisSó seu servidorBom (multilíngue)★★Quem quer rodar localmente / dados privados

Recomendação para o seu caso (PT-BR, iniciante, online, sem servidor próprio): comece com Jina (mais fácil de plugar) ou Voyage (free tier gigante). Deixe Cohere e self-host para depois, se precisar.


Opções online (hospedadas — você só usa uma API key)

1. Jina AI Reranker — mais fácil para começar

  • Modelos: jina-reranker-v2-base-multilingual, jina-reranker-v3 (até 131K tokens de contexto).
  • Grátis: cada API key nova vem com tokens grátis (a documentação da Jina cita 10 milhões de tokens). Limite do plano free: 100 requisições/min.
  • Pago: ~US$ 0,02 por 1 milhão de tokens.
  • Por que é bom para você: multilíngue de verdade (100+ idiomas, português incluso), cadastro simples, uma chave só serve para reranker e embeddings.
  • Links:

2. Voyage AI — melhor camada gratuita

  • Modelos: rerank-2.5, rerank-2.5-lite (32K de contexto, multilíngue, aceita instruções em linguagem natural).
  • Grátis: 200 milhões de tokens grátis por conta — bastante generoso.
  • Pago: rerank-2.5-lite ~US$ 0,02 / 1M tokens; rerank-2.5 ~US$ 0,05 / 1M tokens.
  • Por que é bom: nos benchmarks da própria Voyage, supera o Cohere Rerank v3.5 em precisão; contexto bem maior. Qualidade de ponta com free tier enorme.
  • Links:

3. Cohere Rerank 3.5 — o "padrão de mercado"

  • Modelo: rerank-v3.5 (multilíngue, 100+ idiomas).
  • Grátis: chave Trial com ~1.000 chamadas/mês — porém proibida para uso em produção (só desenvolvimento e teste).
  • Pago: US$ 2,00 por 1.000 buscas (1 busca = 1 pergunta + até 100 documentos). Cobrança por busca, não por token.
  • Por que considerar: muito usado, integração madura, bom em RAG. Mas o modelo de cobrança por busca pode sair mais caro que Jina/Voyage em volume, e o trial não vale para produção.
  • Links:

4. SiliconFlow — barato ao escalar

  • Modelo: hospeda o BAAI/bge-reranker-v2-m3 (open source) como API, compatível com o formato OpenAI/Cohere.
  • Grátis: dá créditos no cadastro; o custo por uso de rerank é em centavos.
  • Por que considerar: muito popular no ecossistema Dify, ótimo custo-benefício. O endpoint é https://api.siliconflow.cn/v1/rerank.
  • Observação: plataforma com base na China — atenção se isso for restrição para seus dados.
  • Link: https://siliconflow.com/

Opção grátis de verdade (self-host)

BAAI/bge-reranker-v2-m3 — rodando na sua máquina

  • Custo: zero de licença (open source, multilíngue). Você paga só a infraestrutura.
  • Como roda: via Xinference, HuggingFace TEI (Text Embeddings Inference) ou a biblioteca FlagEmbedding. Depois você aponta o Dify para esse endpoint.
  • A real: precisa de um servidor (de preferência com GPU; em CPU fica lento). Para um iniciante e uma base pequena, não compensa o trabalho agora — é o caminho de quem precisa manter os dados 100% dentro de casa.
  • Link do modelo: https://huggingface.co/BAAI/bge-reranker-v2-m3

Como ligar um reranker no Dify (passo a passo)

  1. Configurações → Fornecedor de modelo.
  2. Em "Instalar provedores de modelo", procure o provedor escolhido (Cohere, Jina e SiliconFlow têm plugin no Marketplace do Dify) e instale.
  3. Clique em Configuração no provedor e cole a API key que você gerou no site dele.
  4. Abra "Configurações do Modelo do Sistema" e defina o Modelo de Rerank (ex.: jina-reranker-v2-base-multilingual).
  5. Vá na sua base Conhecimento → Central de Ajuda → Configurações de Recuperação (ou no app, em Contexto → Configurações de Recuperação) e:
    • Mude para o modo que usa rerank (geralmente "Rerank model" ativado, ou recuperação híbrida com rerank).
    • Selecione o modelo de rerank.
    • Ajuste o Top K (quantos trechos finais ir para o LLM — comece com 3 a 5).
  6. Teste no Teste de Recuperação da base: faça a mesma pergunta antes e depois de ligar o rerank e compare os trechos retornados.

Dica: o "conector improvisado" que transforma um LLM em reranker tende a ser mais lento e impreciso que um reranker dedicado. Trocar por um dos modelos acima (Jina/Voyage) já resolve.


Veredito para o seu projeto

  • Agora: instale o plugin da Jina (ou Voyage), use o free tier, ligue o rerank na base e compare no Teste de Recuperação. Custo zero, 10 minutos.
  • Não invista em Cohere pago nem em self-host neste momento — não há volume nem necessidade que justifique.
  • Lembre-se: com 263 trechos, a diferença pode ser pequena. Se notar pouca mudança, é normal — guarde o rerank como melhoria para quando a base crescer.

Did this resonate?

Related documents