Documento técnico · transparência
Toda palavra do exame carrega um número. Esta página explica, do começo, o que esse número significa, quem o calcula, por que a mesma palavra pode ter números diferentes em frases diferentes — e mostra, no fim, o valor real de cada palavra do banco.
O resumo, para quem tem pressa. Cada palavra recebe uma nota de surpresa, medida em bits. Palavra que era fácil de adivinhar naquele ponto da frase recebe poucos bits. Palavra que ninguém esperava ali recebe muitos bits. Quem dá a nota é um programa de computador, e não uma pessoa. O restante desta página explica cada uma dessas afirmações devagar.
O exame mede quanto tempo a pessoa gasta em cada palavra que lê, e depois compara esse tempo com a dificuldade da palavra. Ora, para comparar tempo com dificuldade, é preciso ter a dificuldade escrita em número. Senão não há com o que comparar.
E aqui aparece o problema. Se pedirmos a uma pessoa que classifique as palavras como fácil, média ou difícil, cada pessoa vai classificar de um jeito, e a régua muda de aplicador para aplicador. Precisamos de uma régua que seja a mesma para todo mundo, sempre, e que possa ser recalculada por qualquer pesquisador que queira conferir. É isso que o número em bits faz.
Esqueça por um instante a palavra “bit” e pense num jogo de adivinhação que você já jogou.
Eu escolhi uma palavra entre oito palavras que estão numa lista à nossa frente. Você precisa descobrir qual foi, e só pode fazer perguntas de sim ou não. Quantas perguntas você precisa, se jogar bem?
Três. Você pergunta “está na primeira metade da lista?” e corta oito para quatro. Pergunta de novo e corta quatro para duas. Pergunta a terceira vez e chega na palavra. Três perguntas.
Cada pergunta de sim ou não que você precisa fazer é um bit. Descobrir entre 8 palavras custa 3 perguntas, logo custa 3 bits.
Agora a pergunta que muda tudo, e que é a chave desta página inteira: e se você tivesse acertado em duas perguntas?
Se duas perguntas bastaram, é porque a palavra que eu escolhi não era uma entre oito de verdade. Ela era uma entre quatro — alguma coisa no contexto já tinha eliminado metade da lista antes de você começar. Duas perguntas, dois bits.
E se você tivesse acertado de primeira, sem perguntar nada? Zero perguntas, zero bits. A palavra era certa; não havia nenhuma dúvida a resolver.
Guarde essa ideia, porque ela é a definição inteira: bit é a quantidade de dúvida que precisou ser resolvida para chegar naquela palavra. Muita dúvida, muitos bits. Nenhuma dúvida, zero bits.
Repare no que aconteceu no jogo: cada pergunta cortou a lista pela metade. É isso que liga o número de perguntas à probabilidade da palavra.
| Chance que a palavra tinha | Uma em quantas | Bits |
|---|---|---|
| certeza absoluta | 1 em 1 | 0 |
| metade | 1 em 2 | 1 |
| um quarto | 1 em 4 | 2 |
| um oitavo | 1 em 8 | 3 |
| um por cento | 1 em 100 | 6,6 |
| um em mil | 1 em 1.024 | 10 |
| um em um milhão | 1 em 1.048.576 | 20 |
Leia a tabela da direita para a esquerda também, porque é assim que ela costuma ser usada. Se uma palavra do exame aparece com 10 bits, isso quer dizer que o programa deu a ela mais ou menos uma chance em mil de ser a próxima palavra daquela frase. Se aparece com 20 bits, a chance era de uma em um milhão.
E repare no tamanho do salto entre uma linha e a seguinte. De 10 para 11 bits, a chance não cai um pouquinho: ela cai pela metade. É por isso que dois bits de diferença entre duas palavras já é muita coisa — significa que uma era quatro vezes mais improvável que a outra.
A fórmula, agora que a ideia já está de pé. O nome
técnico dessa nota é surprisal, e ela se escreve
−log₂ P(palavra | texto anterior). Traduzindo pedaço por
pedaço: P(palavra | texto anterior) é a chance que o programa deu
àquela palavra, sabendo o que veio antes dela; log₂ é a conta que
pergunta “quantas vezes preciso dividir por dois para chegar aí”; e o sinal de
menos na frente só existe para o resultado sair positivo, já que chance é sempre
menor que 1. Nada além disso.
Quem calcula a chance de cada palavra é um modelo de linguagem — um programa que leu uma quantidade enorme de texto e aprendeu, com isso, a estimar qual palavra costuma vir depois de quais outras. O modelo usado aqui chama-se bloom-560m.
Vale ser preciso sobre quando esse cálculo acontece, porque a resposta costuma surpreender. O modelo não roda durante o teste, e não roda no aparelho do participante. Ele rodou uma vez, com antecedência, na máquina do pesquisador, para calcular a surpresa de cada palavra de cada frase do banco. Esses valores foram gravados num arquivo de 27 KB que viaja junto com o aplicativo.
Isso tem três consequências práticas boas. A página do teste abre instantaneamente, porque não precisa baixar modelo nenhum. O teste funciona num celular modesto, já que a única coisa que ele faz é mostrar palavras e cronometrar toques. E o número de cada palavra é exatamente o mesmo para todos os participantes, porque foi calculado uma vez só — o que seria impossível garantir se cada aparelho calculasse o seu.
Vale insistir num ponto, porque ele é a razão de ser deste método: o modelo não está opinando sobre a palavra, e não está dizendo se ela é bonita, certa ou adequada. Ele está apenas informando qual chance ele atribuiu a ela antes de vê-la. É um número mecânico, e qualquer pessoa que rode o mesmo modelo na mesma frase obtém exatamente o mesmo número.
Antes deste método, a maneira consagrada de obter esse valor era outra: mostrar a frase pela metade a algumas centenas de pessoas e anotar qual palavra cada uma completava. Chama-se normatização por completamento, funciona bem e é usada desde 1953. O problema é que ela precisa ser refeita, com centenas de pessoas, a cada frase nova. Com o modelo, uma frase nova sai calculada em segundos.
Esta é a dúvida mais comum de quem chega agora, e a resposta é sim, e é de propósito.
A nota não pertence à palavra. Ela pertence à palavra naquele lugar daquela frase. A palavra pão depois de “passou manteiga no” recebe poucos bits. A mesma palavra pão depois de “trocou o pneu com um” recebe muitos bits. É a mesma palavra, com as mesmas letras, e as notas são diferentes porque a dúvida que ela resolveu era diferente nos dois casos.
Isso não é um defeito do método: é exatamente o que se quer medir. O exame inteiro depende de a mesma palavra poder ficar barata num contexto e cara em outro.
Quem abre a listagem no fim desta página vê uma coisa que assusta: a primeira palavra de cada frase — muitas vezes um simples o ou a — aparece com uns 19 bits, que é um valor altíssimo. Como pode um artigo ser surpreendente?
Ele não é. O que acontece é que, na primeira palavra, o modelo não tem contexto anterior nenhum para se apoiar. A pergunta que ele está respondendo ali não é “qual palavra vem depois de manteiga?”, e sim “com que palavra um texto qualquer do mundo começa?”. Nessa pergunta, o vocabulário inteiro concorre — inclusive palavras de outros idiomas, porque este modelo foi treinado em várias línguas e, na primeira palavra, ele ainda não sabe em que língua o texto está.
Ou seja: os 19 bits da primeira palavra medem sobretudo a escolha do idioma, e não a dificuldade de leitura daquela palavra.
Por isso a primeira palavra de toda frase é excluída da análise. Na listagem abaixo ela aparece apagada e marcada com a etiqueta fora. Ela não entra em nenhuma conta do resultado.
Agora vem a armadilha, e ela derruba muita gente que olha a listagem pela primeira vez.
O modelo não guarda cada palavra inteira na cabeça. Ele guarda pedaços de palavra, e monta as palavras juntando pedaços. Quando uma palavra precisa de vários pedaços, a nota dela é a soma das notas de cada pedaço. Medido neste próprio banco de frases:
A consequência é direta. Na listagem, biquíni aparece com 36,0 bits e tijolo com 33,7 bits. Seria fácil concluir que biquíni é a palavra mais absurda das duas — e essa conclusão estaria errada. Biquíni tem mais bits porque é uma palavra mais rara, picada em mais pedaços, e cada pedaço soma. Palavra rara acumula bits mesmo sem ser mais inesperada naquele contexto.
Comparar o total de bits de palavras diferentes é comparar raridade e tamanho disfarçados de surpresa. Não faça isso, e desconfie de quem fizer.
Há uma saída limpa para essa armadilha, e é sobre ela que o banco de frases deste exame foi construído.
Pegue a mesma palavra e coloque em duas frases diferentes. Como a palavra é a mesma, o tamanho dela é o mesmo, a raridade dela é a mesma e o número de pedaços é o mesmo dos dois lados. Tudo isso se cancela na subtração. O que sobra na diferença é contexto puro. Veja com valores reais, medidos com o mesmo modelo:
| Frase | Palavra | Bits |
|---|---|---|
| “Para construir o muro, o pedreiro usou um tijolo.” | tijolo | 23,1 |
| “No café da manhã, ela passou manteiga no tijolo.” | tijolo | 33,7 |
| Diferença — só o contexto mudou | 10,6 | |
| Frase | Palavra | Bits |
|---|---|---|
| “Para lubrificar a corrente da bicicleta, ele usou graxa.” | graxa | 30,9 |
| “Antes de dormir, ele escovou os dentes com graxa.” | graxa | 34,0 |
| Diferença — só o contexto mudou | 3,1 | |
O par da graxa ensina a segunda lição. Repare que, mesmo na frase que prepara a palavra graxa — lubrificar a corrente da bicicleta — ela ainda custa 30,9 bits, que é um valor alto. Isso acontece porque graxa é palavra rara em texto escrito. Ou seja:
O valor absoluto de uma palavra é raridade mais contexto misturados. Só a diferença entre duas frases com a mesma palavra é contexto puro.
Vale guardar esse parágrafo, porque ele é também a resposta à crítica mais previsível que o método vai receber numa banca: “a frequência e o tamanho da palavra não explicariam tudo isso sozinhos?”. No desenho pareado usado aqui, frequência e tamanho são idênticos dos dois lados por construção, e portanto não podem explicar a diferença.
O N400 é uma onda elétrica do cérebro, medida com eletrodos no couro cabeludo. Ela aparece cerca de 400 milésimos de segundo depois de a pessoa ver uma palavra, e ela fica mais forte quanto mais inesperada for aquela palavra no contexto. Foi descrita por Kutas e Hillyard em 1980, e é um dos achados mais replicados da neurociência da linguagem.
Um exemplo clássico: na frase “o homem martelou o prego com uma banana”, o cérebro dispara um N400 forte exatamente na palavra banana.
Por que isso importa neste exame. O N400 é a prova biológica de que o cérebro tropeçou na previsão — ele mostra, com eletricidade, o mesmo fenômeno que este exame mede com o relógio. A hesitação que a pessoa tem na palavra inesperada, e que aqui vira milissegundos, é o reflexo comportámental desse N400. As frases de final absurdo do banco foram escritas justamente para provocar essa onda.
E há um detalhe que fecha o argumento. No comprometimento cognitivo leve e na doença de Alzheimer, o N400 costuma vir reduzido e atrasado: a diferença de resposta elétrica entre a palavra esperada e a inesperada encolhe. Ou seja, o cérebro deixa de separar bem uma da outra — que é exatamente a mesma descrição, em outra linguagem, do achatamento da reta que este exame procura. A Fase 2 do projeto pretende medir as duas coisas na mesma pessoa, para verificar se elas concordam.
Abaixo está o banco inteiro usado no exame, com a surpresa em bits de cada palavra. Cada frase-base aparece nas suas três versões, uma embaixo da outra: final esperado, final possível e final absurdo. Como as três versões são idênticas até a última palavra, você pode conferir com os próprios olhos que só o número da última palavra muda — que é precisamente o que o desenho do banco promete.