
O agente de IA disse que terminou. O banco de dados discordou.
Microsoft lança ferramenta que avalia agentes de IA não pelo que dizem, mas pelo rastro que deixam nos sistemas — e descobriu que a maioria erra quando precisa repetir a mesma tarefa vinte vezes seguidas

















