Análise Aponta Limitações dos Chatbots em Saúde
Um recente estudo publicado na revista Nature Medicine trouxe à tona preocupações sobre a eficácia dos chatbots de inteligência artificial (IA) ao fornecer orientações de saúde. Os pesquisadores descobriram que essas ferramentas, que se tornaram populares entre usuários em busca de informações médicas, não superam o Google em precisão. A pesquisa revelou que os chatbots, em muitos casos, falham em orientar adequadamente os usuários sobre diagnósticos e passos a seguir, o que pode representar riscos significativos para a saúde.
Os pesquisadores realizaram um experimento com mais de 1.200 participantes britânicos, a maioria sem formação médica. Eles foram apresentados a situações médicas fictícias, com sintomas detalhados e históricos de saúde. O objetivo era verificar se esses usuários poderiam identificar a conduta correta, como chamar uma ambulância ou automedicar-se, ao interagir com chatbots como o ChatGPT da OpenAI e o Llama da Meta.
Os resultados foram alarmantes. Menos da metade dos participantes escolheu a conduta considerada ‘correta’ por um painel de médicos, e apenas 34% identificaram corretamente condições como cálculos biliares ou hemorragia subaracnóidea. Além disso, o desempenho dos usuários não foi melhor do que o grupo de controle que utilizou métodos tradicionais de pesquisa, como o Google.
Desafios na Interação com Chatbots
O estudo, que é o primeiro do tipo a ser realizado de maneira randomizada, levantou questões sobre a interação humana com chatbots em saúde. Adam Mahdi, professor do Instituto de Internet de Oxford e um dos autores do estudo, destacou que a medicina é uma área complexa e não pode ser reduzida a simples perguntas e respostas. “A medicina é complexa, incompleta, estocástica”, afirmou Mahdi, refletindo sobre as limitações dos chatbots.
Apesar do entusiasmo inicial em torno da IA, que demonstrou avanços ao ser aprovada em exames de licenciamento médico e até mesmo superando médicos em diagnósticos de problemas complexos, a realidade é que as interações dos usuários com esses modelos muitas vezes resultam em diagnósticos equivocados. A pesquisa mostrou que, quando as informações relevantes eram inseridas nos chatbots, a precisão dos diagnósticos aumentava significativamente. Em casos onde o quadro médico completo foi fornecido, os chatbots acertaram o diagnóstico em 94% das vezes.
Responsabilidade na Coleta de Informações
Um ponto crítico levantado pelos pesquisadores é sobre a responsabilidade na coleta de informações. Andrew Bean, estudante de pós-graduação em Oxford e principal autor do artigo, questionou se o ônus de elaborar a pergunta perfeita deve recair sobre o usuário ou se os chatbots deveriam ser mais proativos em fazer perguntas complementares, como fazem os médicos. Atualmente, os modelos de IA estão melhorando nesse sentido, com as versões mais recentes do ChatGPT apresentando uma taxa maior de perguntas adicionais comparadas a versões anteriores.
No entanto, mesmo com os avanços, os chatbots continuam a ter dificuldades em diferenciar entre casos que requerem atenção médica imediata e aqueles que podem ser tratados em casa. Danielle Bitterman, doutora que investiga a interação entre pacientes e IA, observou que isso pode ser devido ao fato de que os chatbots são principalmente treinados com livros didáticos médicos, com menos foco na tomada de decisões práticas que médicos experientes aprendem ao longo de suas carreiras.
Riscos de Informação Falsa
Outro problema identificado no estudo é a tendência de alguns chatbots de fornecer informações inventadas ou inconsistentes. Em uma das situações analisadas, um modelo sugeriu um número de emergência que, na verdade, não existia. Além disso, a precisão das respostas dos chatbots variava de acordo com a maneira como os participantes formulavam suas perguntas, evidenciando que pequenas mudanças na descrição dos sintomas podiam levar a conselhos muito diferentes.
O estudo serve como um alerta sobre os riscos associados ao uso de chatbots para orientações médicas. Apesar de suas capacidades, é evidente que essas ferramentas ainda necessitam de melhorias significativas antes de serem consideradas seguras e eficazes para o atendimento ao paciente.
