O que clientes dizem sobre o trabalho com a Kaleidon
Relatos de equipes que participaram de workshops, implantaram sandboxes e produziram documentação interna de modelos de IA.
← Página InicialAnos de operação
Organizações atendidas
Avaliação média (de 5)
Projetos entregues no prazo
Relatos de quem trabalhou com a Kaleidon
Participei do workshop de vocabulário com três pessoas do meu time. O que mais me surpreendeu foi a parte sobre concordância entre avaliadores — nunca tínhamos parado para formalizar isso e percebemos que as nossas avaliações internas eram praticamente incomparáveis entre si. Saímos com um glossário que agora usamos nas especificações de projetos.
Contratamos o sandbox depois de uma situação em que dois analistas chegaram a conclusões opostas sobre o mesmo modelo usando critérios diferentes. A configuração do harness nos deu estrutura para repetir comparações de forma que o resultado faça sentido independentemente de quem executa. O guia de manutenção foi especialmente útil quando eu saí de férias.
Precisávamos documentar quatro ferramentas de IA que usamos em processos internos. O programa de doze semanas foi trabalhoso — requer envolvimento real dos responsáveis internos — mas o resultado é sólido. Hoje temos registros que usamos de base para reuniões com a área jurídica e para onboarding de novos colaboradores.
O que me agradou na Kaleidon foi a clareza sobre o que eles não fazem. Deixaram claro logo de início que não vão dizer qual modelo é melhor e que o sandbox é para a equipe do cliente operar, não para eles. Isso foi determinante para nós, porque temos restrições internas sobre envio de dados para terceiros.
Fizemos o workshop com um grupo misto — analistas, uma pessoa de comunicação e uma de projetos. Achei que ia ser técnico demais para os não-analistas, mas não foi. O ritmo foi bom e o glossário em português foi bem recebido por todos. Um ponto que poderia melhorar é ter mais exemplos de tarefas diferentes.
O programa de documentação foi o que fez sentido para o nosso estágio: temos sete ferramentas de IA em produção e nenhuma documentação interna sobre elas. A Camila foi rigorosa nas sessões de entrevista — perguntou coisas que nunca tínhamos formalizado. O resultado foram oito documentos que agora usamos para orientar novos membros.
Como o trabalho aconteceu na prática
Empresa de logística precisava comparar modelos de extração de dados sem enviar informações para serviços externos
A equipe avaliava modelos de extração de texto manualmente, usando planilhas diferentes a cada rodada. Os resultados não eram comparáveis entre si e a empresa tinha restrições de compliance para não enviar dados de clientes para APIs externas.
Implantamos o harness na infraestrutura interna da empresa, configuramos um editor de rubrica para os tipos de extração que eles fazem e criamos um registro de resultados em formato que o time de análise já conhecia. Duas sessões de handover com a pessoa responsável pela manutenção.
Ao final das quatro semanas, a equipe tinha executado três rodadas de comparação de forma independente. O registro de resultados agora é consultado antes de qualquer decisão sobre mudança de modelo. A empresa não precisou abrir exceção de compliance.
Consultoria de RH com cinco ferramentas de IA em produção e nenhum registro compartilhado sobre como funcionavam
A empresa usava cinco ferramentas de IA para diferentes etapas do processo de recrutamento. O conhecimento sobre cada ferramenta estava disperso entre as pessoas que as tinham configurado, com risco de perda quando essas pessoas mudassem de time.
Realizamos doze semanas de entrevistas com responsáveis e sessões de revisão estruturada. Para cada ferramenta, produzimos um documento com escopo pretendido, condições testadas, pontos conhecidos de falha e caminhos de escalonamento para revisão humana.
Cinco documentos de modelo entregues, além de um modelo vivo extensível para as ferramentas que seriam adicionadas no futuro. A empresa usou os documentos como base para uma revisão interna de governança realizada dois meses após o encerramento.
Equipe de produto precisava encomendar avaliações sem saber como especificá-las de forma que os resultados fossem comparáveis
A empresa terceirizava avaliações de modelos para prestadores externos, mas os resultados voltavam em formatos inconsistentes. A equipe não sabia como especificar a avaliação de forma que o resultado fosse comparável com avaliações anteriores.
Workshop de um dia com sete pessoas — gerentes de produto, uma pessoa de procurement e dois analistas. Cobrimos definição de tarefa, especificação de amostragem e como redigir uma rubrica que um avaliador externo consiga aplicar sem consultar os internos.
A equipe reformulou os contratos com prestadores de avaliação usando os modelos de rubrica do workshop. Na rodada seguinte de avaliação, os resultados voltaram em formato que permitia comparação direta com a rodada anterior — algo que não acontecia antes.
Fale com a Kaleidon
Botafogo, Rio de Janeiro - RJ
CEP 22270-014
Segunda a sexta: 9h às 18h (BRT)
Sábado: 9h às 13h
Menção em relatório ABNT sobre terminologia de avaliação de IA em português (2024)
Colaboração com grupo de pesquisa em NLP da UFRJ em metodologia de anotação (2023)
Guia de boas práticas em avaliação de LLMs para equipes não técnicas — publicação aberta (junho 2025)
Membro da Rede Brasileira de Transparência Algorítmica desde 2022
Quer saber como funciona para o seu contexto?
Entre em contato. Conversamos sobre o que sua equipe precisa sem pressão e sem terminologia de impacto.
Iniciar Conversa