AI Safety2026-09-24
OpenAI Blog
OpenAI lança MentalHealthBench para saúde mental
A OpenAI apresentou o MentalHealthBench, um novo benchmark concebido para medir quão úteis e seguros são os sistemas de IA em conversas realistas sobre saúde mental. A ferramenta foi desenvolvida com contributos de especialistas e centra-se em cenários sensíveis, onde uma avaliação genérica deixaria escapar nuances importantes.
Em vez de testar apenas conhecimento factual ou fluência, o MentalHealthBench analisa se um modelo responde com o apoio adequado, evita conselhos prejudiciais e reconhece quando deve incentivar o utilizador a procurar cuidados profissionais.
O benchmark avalia tanto o apoio prestado como o risco. Essa dupla focagem é importante porque uma resposta pode soar empática e ainda assim dar orientações perigosas, ou pode ser cautelosa mas falhar em oferecer ajuda útil. O MentalHealthBench oferece uma forma estruturada de testar modelos em conversas difíceis, incluindo momentos de mal-estar, confusão ou vulnerabilidade. A intenção é ajudar os programadores a identificar fragilidades antes da implementação e a acompanhar progressos ao longo do tempo.
O lançamento reflete a preocupação crescente com a forma como as pessoas usam a IA para apoio em saúde mental. Os chatbots estão acessíveis a qualquer hora e podem parecer privados, o que os torna atrativos para utilizadores que não têm acesso imediato a um terapeuta ou a um serviço de crise. Mas não substituem profissionais formados e podem causar danos se lidarem mal com situações graves. Benchmarks como o MentalHealthBench procuram tornar essas limitações mais mensuráveis.
Levantam também questões mais amplas sobre responsabilidade. Se um modelo é implementado num contexto ligado à saúde, que nível de segurança deve ser exigido? Como devem as empresas lidar com situações de crise, privacidade e encaminhamento para cuidados humanos? O MentalHealthBench não responde a todas as questões de política, mas dá a investigadores e reguladores um ponto de referência comum. À medida que a IA se integra mais na vida diária, avaliações que combinam empatia, exatidão e consciência do risco serão cruciais para construir sistemas que apoiem as pessoas sem as enganar ou colocar em perigo.