have to offer
A IA teve melhor desempenho em raciocínio clínico e em empatia. O que isso revela sobre o nosso trabalho

Durante muito tempo, o raciocínio clínico e a relação com o doente foram descritos como as duas coisas que nenhuma máquina faria. Entre 2025 e 2026, as duas foram medidas, e os modelos de linguagem tiveram melhor desempenho em algumas comparações. A leitura mais útil destes resultados não é apenas sobre a tecnologia. É sobre as condições em que o trabalho clínico acontece.
Treze estudos em quinze deram vantagem à máquina
Uma revisão sistemática publicada no British Medical Bulletin reuniu 15 estudos que compararam respostas de chatbots com respostas de profissionais de saúde. Treze encontraram avaliações de empatia mais altas para a IA. Os dois que favoreceram os humanos eram de dermatologia.
Antes de continuar, convém fixar o que foi medido. A empatia foi avaliada a partir de respostas escritas, por observadores, e não diretamente pelos doentes. Os próprios autores assinalam que essa avaliação deixa de fora a comunicação não verbal. Nenhum destes estudos avaliou uma consulta clínica completa.
Mesmo assim, o resultado não se dissolve com essa ressalva. Num estudo publicado no Journal of General Internal Medicine, 1454 participantes avaliaram respostas a perguntas publicadas num fórum médico. As respostas de IA foram consideradas mais empáticas mesmo quando se dizia às pessoas que tinham sido escritas por uma máquina. A preferência por receber ajuda de um profissional continuava lá, embora as respostas da IA fossem mais bem avaliadas.
O que os investigadores encontraram dentro das respostas
A parte interessante desse estudo não é só a pontuação. É a análise do conteúdo. Assistentes de investigação leram as respostas e classificaram o que lá estava: as da IA tinham mais validação do que a pessoa estava a sentir, mais linguagem sem julgamento, mais reasseguramento e mais organização. Foram também classificadas como menos apressadas do que as dos médicos.
Nada nesta lista exige uma capacidade que um profissional de saúde não tenha. Exige disponibilidade para responder com atenção, num contexto em que esse tempo nem sempre existe.
Na urgência, o modelo nunca esteve com o doente
No raciocínio clínico, o resultado é ainda mais desconfortável. Em abril de 2026, a Science publicou cinco experiências em que um modelo de linguagem e centenas de médicos, de internos a especialistas, resolveram os mesmos casos clínicos difíceis. Um sexto estudo repetiu a comparação com 76 doentes reais, selecionados ao acaso na urgência de um hospital universitário de Boston, em três momentos de decisão que incluíam a triagem, quando a informação ainda é escassa. Na maioria das tarefas, o modelo igualou ou excedeu os médicos.
Vale a pena olhar para o que o modelo recebeu. Mesmo na urgência, recebeu informação clínica já registada por quem tinha estado com aquela pessoa. Alguém falou com o doente, alguém o examinou, alguém decidiu o que valia a pena escrever e o que ficava de fora. Esse trabalho não entra na comparação, porque é a condição prévia dela.
Onde os modelos caem é na construção do caso
Também em abril de 2026, no JAMA Network Open, 21 modelos, entre eles o GPT-5, o Gemini, o Grok, o Claude e o DeepSeek, resolveram 29 casos clínicos padronizados, com a informação a chegar por etapas. As respostas foram avaliadas contra a solução de referência de cada caso.
Os resultados separam-se de forma nítida. No diagnóstico final, com todos os dados disponíveis, a taxa de falha ficou abaixo dos 40% em todos os modelos. Na construção da lista de diagnósticos diferenciais, no início do caso e com pouca informação, ultrapassou os 80% em todos os 21 modelos.
A distinção importa mais do que parece. A lista inicial de hipóteses orienta o resto do raciocínio: define que perguntas fazer e que exames pedir. Acertar no fim, quando o caso já está montado, é uma tarefa diferente de construir esse caso enquanto a informação ainda é incompleta.
Quinze minutos, e o que não cabe lá dentro
Uma revisão sistemática de 67 países, publicada em 2017 na BMJ Open, registou para Portugal uma duração média de 15,9 minutos por consulta de medicina geral e familiar. Era um dos valores mais altos da lista. Em 18 países, que representavam cerca de metade da população mundial, a média era de cinco minutos ou menos. Estes números descrevem os estudos disponíveis à data, não a duração atual de cada consulta.
Aplicar uma norma e escrever uma resposta correta pode caber em quinze minutos. Ouvir o que a pessoa não chega a dizer, perceber o que está por trás de um resultado que piorou, ajustar o tratamento à vida de quem o vai cumprir e falar do que vem a seguir, isso raramente cabe.
Há aqui uma ironia que convém dizer em voz alta. Os dois terrenos em que a IA ganhou são precisamente aqueles em que o trabalho clínico foi reduzido à sua versão escrita. As experiências mostram o que os modelos conseguem fazer nesse recorte. Não medem tudo o que acontece numa relação clínica.
A escolha não é da tecnologia
Uma parte considerável do trabalho clínico acontece hoje no computador: registar dados, preencher campos, escrever notas e cartas. É aí que a IA pode ter um contributo imediato e devolver minutos à consulta, se for usada com supervisão e atenção à segurança.
O que acontece a esses minutos não depende do modelo. Depende de quem organiza os serviços e dos indicadores que usa para os avaliar. Se a métrica continuar a ser apenas o número de consultas realizadas, o tempo libertado poderá ser ocupado por mais consultas. Se também contar o que acontece dentro delas, poderá abrir espaço para ouvir melhor.
É uma decisão de gestão, tomada em nome de uma ferramenta que não a pode tomar por nós.
O QUE FICA
- Em tarefas escritas de raciocínio clínico e de avaliação de empatia, alguns modelos tiveram melhor desempenho do que os profissionais comparados.
- Na empatia, as respostas da IA foram classificadas como menos apressadas. Os estudos avaliaram sobretudo texto, não consultas completas.
- Nos casos reais da urgência, o modelo trabalhou sobre informação clínica registada por profissionais que tinham estado com o doente.
- Ao construir a lista inicial de hipóteses, os 21 modelos avaliados no estudo do JAMA Network Open falharam em mais de 80% das respostas.
- O destino do tempo que a IA libertar dependerá das escolhas de organização dos serviços.
Fontes
- Brodeur PG, Buckley TA, Kanjee Z, et al. Science, 2026;392:524–527. doi:10.1126/science.adz4433
- Rao AS, et al. JAMA Network Open, 2026;9(4):e264003. doi:10.1001/jamanetworkopen.2026.4003
- Howcroft A, Bennett-Weston A, Khan A, et al. British Medical Bulletin, 2025;156(1):ldaf017. doi:10.1093/bmb/ldaf017
- Ruben MA, Blanch-Hartigan D, Hall JA. Journal of General Internal Medicine, 2025;41(5):1304–1311.
- Irving G, Neves AL, Dambha-Miller H, et al. BMJ Open, 2017;7(10):e017902. doi:10.1136/bmjopen-2017-017902