Um bom desempenho em um teste é evidência sobre como um sistema se comportou naquela tarefa e sob aquelas condições. O que ele não estabelece, sozinho, é que a ferramenta seja adequada para determinado uso clínico.
Um estudo publicado em 14 de setembro de 2026 ajuda a entender essa diferença.
Pesquisadores ligados à University of Texas Health Science Center at Houston e à Yale School of Medicine avaliaram o Qwen3-Omni, um modelo multimodal, no exame do estado mental, procedimento utilizado principalmente na avaliação psiquiátrica. Foram 396 classificações distribuídas por dez áreas, a partir de vídeos de pacientes simulados.
A concordância entre os especialistas, medida pelo coeficiente Gwet’s AC1, foi de 0,87. Entre o modelo e os especialistas, ficou entre 0,70 e 0,72. No próprio estudo, os autores descrevem a primeira como concordância substancial e a segunda como moderada.
Esses valores não significam “87% de acerto humano contra 70% da IA”. São coeficientes de concordância, e transformá-los em um placar simples entre pessoas e máquinas produziria uma leitura errada do resultado.
O dado mais interessante aparece quando observamos onde os erros ocorreram.
O Qwen3-Omni tendia a sinalizar alterações em excesso em aspectos mais diretamente observáveis, como características da fala e do afeto. Em outros domínios, nos quais era necessário interpretar aquilo que a pessoa relatava sobre a própria experiência, houve maior tendência a deixar alterações passarem despercebidas.
Naquele experimento, a concordância do modelo com os especialistas também diminuiu à medida que aumentava a gravidade dos quadros simulados. Uma análise adicional com uma arquitetura diferente, o Phi-4-Multimodal-Instruct, encontrou um padrão semelhante de erros entre os domínios avaliados.
Os autores interpretam esse padrão como compatível com maior dificuldade em tarefas que exigem inferência a partir de informações menos diretamente observáveis.
Essa interpretação precisa permanecer do tamanho do estudo.
Estamos falando de Psiquiatria, de um procedimento específico, de pacientes simulados e de modelos específicos. O trabalho não demonstra que sistemas de inteligência artificial, de maneira geral, sejam incapazes de raciocinar clinicamente. Também não estabelece que o mesmo padrão se repetiria em avaliação psicológica, psicoterapia, acompanhamento longitudinal, português brasileiro ou outros contextos linguísticos e culturais.
O estudo é útil porque ilustra uma distinção maior: saber quanto uma tecnologia acerta pode não ser suficiente para decidir o que podemos fazer com esse desempenho.
Também precisamos saber onde ela erra, em quais condições, com quem foi avaliada, qual decisão sua saída pode alterar e o que acontece quando está errada.
Essas perguntas não são estranhas à tradição científica e profissional da Psicologia. Não é necessário dominar programação, redes neurais ou arquitetura de modelos para começar a formulá-las.
A tecnologia pode ser nova. A disciplina de perguntar antes de confiar não é.
O que um bom resultado permite concluir
Também ajuda separar três perguntas que às vezes aparecem misturadas.
A primeira é sobre desempenho da tarefa: o sistema consegue executar aquilo que foi testado, naquelas condições?
A segunda é sobre alcance da inferência: até onde esse resultado nos autoriza a inferir que o desempenho se sustenta para aquela função, em determinada população e contexto?
A terceira é sobre benefício no uso pretendido: quando a ferramenta entra no trabalho, produz algum ganho clínico ou operacional relevante em comparação com a alternativa disponível?
As três perguntas não exigem necessariamente o mesmo tipo de evidência.
Um teste comparativo bem desenhado pode ser exatamente a evidência adequada para sustentar uma afirmação específica sobre desempenho em uma tarefa delimitada. O problema surge quando esse resultado passa a sustentar, sem evidência adicional, uma afirmação maior sobre generalização, influência em decisões clínicas ou benefício no uso real.
Em 2025, 117 especialistas de 50 países publicaram no BMJ as diretrizes FUTURE-AI para inteligência artificial em saúde. As diretrizes organizam 30 recomendações ao longo do ciclo de vida dessas tecnologias em seis princípios: equidade, universalidade, rastreabilidade, usabilidade, robustez e explicabilidade.
A lógica é importante para quem trabalha com tecnologia clínica: desempenho não pode ser separado de finalidade, contexto de uso, população, generalização, interação entre profissional e tecnologia, riscos e monitoramento.
Por isso, uma pergunta como:
essa inteligência artificial funciona?
costuma ser pequena demais.
Uma pergunta profissionalmente mais útil seria:
funciona para quê, com quem, em quais condições e com qual consequência se estiver errada?
Uma ferramenta pode ser excelente para organizar informações de prontuário e não ter evidência suficiente para participar de uma avaliação de risco. Um modelo pode funcionar bem em determinada população e perder desempenho em outra. Pode responder corretamente a casos preparados para pesquisa e se comportar de maneira diferente diante de informações incompletas, contraditórias ou fora da distribuição em que foi avaliado.
Faz mais sentido, portanto, falar em evidência suficiente para determinado uso e para determinada afirmação sobre esse uso do que tratar uma tecnologia como genericamente “validada para a clínica”.
A comparação com uma prática conhecida da Psicologia ajuda. Um instrumento não se torna apropriado para qualquer finalidade apenas porque apresentou bons índices em um estudo. Perguntamos o que pretende medir, para qual objetivo, em qual população, quais evidências sustentam determinada interpretação e quais são seus limites.
Não porque testes sejam inúteis. Justamente porque precisamos interpretar corretamente o que eles demonstram.
Uma literatura enorme pode responder a perguntas diferentes
Uma revisão publicada na Nature Medicine em 2026 identificou 4.609 estudos revisados por pares sobre grandes modelos de linguagem aplicados à medicina, publicados entre janeiro de 2022 e setembro de 2025.
Desses, 1.048 utilizaram dados reais de pacientes. Apenas 19 foram classificados no nível mais alto adotado pelos autores: avaliações prospectivas randomizadas de sistemas implantados em ambientes clínicos vivos.
O contraste não significa que apenas esses 19 estudos tenham valor.
Casos simulados podem avaliar desempenho em tarefas delimitadas e ajudar a investigar determinadas capacidades. Dados retrospectivos permitem examinar modelos diante de informações clínicas já existentes. Estudos prospectivos acompanham uma intervenção para frente, mas “prospectivo”, sozinho, não significa “mundo real”.
São desenhos que respondem a perguntas diferentes. Nenhum deles ocupa automaticamente o lugar de “evidência correta” para toda finalidade.
Um teste comparativo pode responder adequadamente a uma pergunta estreita sobre desempenho sem, por isso, demonstrar generalização ou benefício no uso. O desenho precisa corresponder à afirmação que se pretende sustentar.
Na literatura específica de saúde mental, essa diferença também aparece.
Uma revisão sistemática publicada em 31 de agosto de 2026 reuniu 66 estudos sobre LLMs generalistas em tarefas diretamente relacionadas ao cuidado em saúde mental: 37 utilizaram vinhetas ou simulações, 22 eram retrospectivos e sete prospectivos. Dos 14 estudos classificados pelos autores como apoio à decisão clínica, 13 utilizaram vinhetas.
Os resultados não foram uniformemente negativos.
Na avaliação GRADE da revisão, documentação e monitoramento apresentaram a evidência mais consistente, com certeza moderada. Os seis estudos dessa categoria encontraram resultados positivos sobretudo em tarefas estruturadas de extração, classificação, sumarização e documentação.
Ainda havia um limite claro: cinco eram retrospectivos e um utilizava cenário simulado. Nenhum avaliou prospectivamente a implementação dessas funções.
Esse contraste é importante porque mostra o que uma régua crítica deveria conseguir fazer. Ela não serve apenas para concluir que “a evidência é insuficiente”. Pode reconhecer que a base é melhor para algumas funções do que para outras e, ao mesmo tempo, identificar o que ainda falta demonstrar.
Em outros domínios, os autores classificaram como baixa a certeza da evidência e não encontraram suporte suficiente para uso rotineiro e não supervisionado de LLMs em tarefas como diagnóstico, avaliação de risco, resposta a crises ou interação terapêutica.
Essa é a conclusão da revisão, não uma regra universal sobre inteligência artificial.
E existe uma pergunta que um bom desempenho em um teste não responde:
quando a ferramenta entra no trabalho, o que melhora?
Uma tecnologia pode apresentar ótimo desempenho em uma tarefa sem reduzir erros profissionais, melhorar continuidade do cuidado, poupar tempo de maneira relevante ou produzir outro benefício clínico ou operacional demonstrável.
Acertar é evidência de desempenho. Ser útil exige descobrir o que esse desempenho muda, quando essa utilidade faz parte da afirmação que estamos fazendo sobre a ferramenta.
O mesmo número pode esconder riscos diferentes
Imagine duas ferramentas que acertam oito em cada dez situações de determinado teste.
Na primeira, os erros aparecem em situações de baixa consequência clínica. Na segunda, concentram-se justamente nos casos em que uma interpretação equivocada pode alterar uma decisão importante.
A taxa agregada é igual.
A consequência possível não é.
Um erro ao resumir uma anotação administrativa não tem o mesmo peso que um erro relacionado à avaliação de risco.
Isso não significa que toda ferramenta ligada ao cuidado precise passar pelo mesmo caminho de validação, nem que funções de baixo impacto devam esperar evidência prospectiva para cada uso possível.
Como princípio de prudência, a exigência de evidência deve acompanhar o alcance da afirmação que fazemos sobre a tecnologia, o grau de influência que sua saída exerce sobre uma decisão e a consequência possível de um erro.
Quanto maior o salto entre aquilo que foi observado e aquilo que pretendemos afirmar ou fazer com a saída, maior o ônus de evidência para justificar esse salto.
A direção contrária também importa.
Não é razoável presumir que funções de impactos muito diferentes devam exigir exatamente o mesmo tipo e nível de evidência clínica. Isso não reduz exigências de privacidade, segurança, confiabilidade ou proteção de dados em funções de menor impacto clínico.
Uma heurística útil é distinguir três movimentos: detectar uma informação, interpretar o que ela pode significar e decidir se aquela interpretação deve influenciar o cuidado. Eles não formam uma hierarquia rígida.
Uma ferramenta usada apenas para detectar um sinal de risco pode ter impacto maior que outra empregada para produzir uma inferência de baixa consequência.
A pergunta relevante é:
qual decisão essa saída pode alterar e o que pode acontecer quando ela falha?
Nem todo erro nasce dentro do modelo
Podemos falar do erro produzido pelo próprio modelo: uma classificação incorreta, uma informação omitida, uma inferência inadequada.
Mas também existe o erro produzido na interação com a ferramenta. Um profissional pode interpretar mal uma saída, confiar nela além do que a evidência permite ou deixar de buscar informação adicional depois que uma resposta automatizada parece satisfatória.
E existe o erro produzido pela integração da tecnologia ao fluxo de trabalho. Um sistema pode apresentar desempenho aceitável isoladamente e ainda criar novos problemas ao selecionar o que chega primeiro à atenção profissional, resumir informações ou reorganizar prioridades.
O viés de automação é um dos mecanismos possíveis nesse tipo de interação, não um sinônimo de todo erro de integração. A literatura descreve a possibilidade de confiança excessiva na automação reduzir a vigilância na busca e no processamento de informações, especialmente quando a tarefa e o contexto dificultam a verificação independente.
Isso muda a pergunta sobre supervisão humana.
Dizer que existe um “humano no circuito” informa pouco se não soubermos o que esse profissional consegue realmente fazer.
Supervisão real exige que ele consiga acessar as informações relevantes, compreender os limites da saída, contestá-la e seguir outro caminho. Exige também condições concretas para isso: tempo, informação e autoridade para discordar.
Uma resposta automatizada clara e plausível pode ser muito útil. Mas qualidade de apresentação e qualidade da evidência continuam sendo coisas diferentes.
Uma hipótese bem escrita continua sendo uma hipótese.
Uma régua prática para quem atende
Profissionais da Psicologia não precisam se transformar em engenheiros de inteligência artificial para começar a avaliar criticamente uma ferramenta.
Algumas perguntas concentram boa parte do problema:
O que a ferramenta faz, para qual finalidade foi testada e o que estamos afirmando a partir desse resultado?
Com quais pessoas, em quais condições e até onde esse desempenho pode ser transportado para o contexto em que será usado?
Onde ela costuma errar, qual decisão sua saída pode alterar e qual pode ser a consequência desses erros?
O profissional consegue revisar, contestar e seguir outro caminho de verdade?
Se a ferramenta promete benefício clínico ou operacional, esse benefício foi demonstrado?
E comparada a quê: ao trabalho sem a ferramenta, a outro sistema ou a algum padrão de referência relevante?
Nenhuma tecnologia entra em um vazio.
Uma ferramenta pode ser imperfeita e ainda representar melhora real em relação ao processo disponível. Também pode apresentar números impressionantes e não acrescentar vantagem quando comparada à alternativa que já existe.
O comparador adequado não é um ser humano imaginário que nunca erra, nem uma máquina imaginária que deveria acertar tudo.
É a alternativa real para aquela finalidade.
Essa régua também orienta uma escolha institucional da Conexão Psicológica: usamos inteligência artificial como apoio ao trabalho profissional, não como fonte autônoma de autoridade clínica, sem tratar essa escolha de arquitetura como evidência de eficácia da própria plataforma.
O restante precisa ser demonstrado para cada uso, no nível adequado à afirmação que se pretende sustentar.
Por isso, talvez “essa IA é boa?” seja uma pergunta pequena demais.
Uma pergunta mais profissional seria:
boa para fazer o quê, com quem, em quais condições, comparada a quê, quais erros produz, qual decisão pode alterar e o que acontece se falhar?
Um bom resultado em pesquisa é evidência.
O que ele permite afirmar e fazer precisa ser demonstrado separadamente.
Infraestrutura para um julgamento clínico mais bem informado
A Conexão Psicológica organiza instrumentos, prontuário e documentação para apoiar o trabalho profissional sem substituir sua autoria clínica.
Criar conta