LenserFight: Plataforma local-primeiro para avaliar agentes de IA e prompts
LenserFight, da Conectlens, é uma plataforma aberta para projetar e avaliar agentes de IA, prompts reutilizáveis e fluxos de trabalho de avaliação. Ela serve como um laboratório de IA que permite que equipes criem "Lentes" versionadas, executem fluxos de trabalho de gráfico acíclico direcionado e organizem eventos de avaliação que misturam pontuação de rubrica com julgamento humano. A ferramenta inclui um servidor de Protocolo de Contexto de Modelo (MCP), opções de execução de modelo local e uma arena pública para logs compartilhados. Os usuários-alvo são desenvolvedores de IA, engenheiros de prompts e pesquisadores focados em avaliação reprodutível e benchmarking privado.
Quais tarefas a plataforma permite que você especifique e reproduza?
A plataforma trata uma tarefa como uma "Lente" formal, uma especificação versionada que combina um prompt, uma rubrica de avaliação e um esquema opcional para saídas estruturadas. Lentes atuam como casos de teste reutilizáveis, permitindo que as equipes executem instruções idênticas em modelos e preservem versões para auditoria. Este design suporta artefatos de avaliação estruturados em vez de prompts ad-hoc, o que ajuda na comparação de resultados entre execuções de modelos ou na replicação de experimentos.
Como são produzidas e comparadas as pontuações de avaliação?
Eventos de avaliação utilizam um modelo de pontuação dual, combinando pontuação de rubrica automatizada com votos humanos impulsionados pela comunidade para produzir rankings públicos e classificações no estilo ELO. A combinação visa equilibrar métricas objetivas de rubrica com julgamentos qualitativos humanos. A confiabilidade depende do design da rubrica e da amostragem de eleitores humanos, portanto, as comparações são tão reproduzíveis quanto as Lentes e os registros de execução gravados que acompanham cada execução.
Quais entradas e ambientes de execução são suportados?
O servidor MCP expõe mais de trinta ferramentas para integração com clientes do Protocolo de Contexto de Modelo, e a plataforma suporta orquestração de modelos locais através de Ollama, vLLM e llama.cpp. Clientes baseados na web se integram via OAuth 2.1 PKCE. Essas opções permitem que as equipes realizem experimentos conectados à nuvem e offline, possibilitando a comparação lado a lado de assistentes locais e remotos através de um único ponto de extremidade MCP.
Como a plataforma se encaixa em um fluxo de trabalho consciente da privacidade?
O projeto adota uma postura local-primeiro, permitindo execuções de modelos offline para benchmarking e privacidade de dados, enquanto também oferece uma arena comunitária pública para logs e tutoriais compartilhados. A base de código é open source no GitHub e o projeto está em uma fase beta experimental, portanto, as organizações devem planejar para desenvolvimento ativo, moderação comunitária de Batalhas e uma fase de configuração técnica antes de confiar nele para avaliações formais.
A plataforma atende equipes tecnicamente proficientes que buscam comparações de modelos reproduzíveis e controladas localmente
A plataforma é uma opção prática para desenvolvedores de IA e pesquisadores que aceitam a sobrecarga de configuração para obter artefatos de teste versionados e controle de execução local. Seu estado beta experimental e o modelo de avaliação orientado pela comunidade significam que os resultados exigem um design cuidadoso de rubricas e moderação para serem confiáveis. Para equipes que priorizam benchmarking reproduzível e execuções de modelos locais, a plataforma oferece uma estrutura de avaliação clara; para usuários não técnicos, a complexidade da configuração pode limitar a utilidade imediata.





