As contas, com dois idosos

Por que o número que separa as pessoas nunca é um valor sozinho, e sim a distância entre dois valores da mesma pessoa.

Os números abaixo são inventados de propósito, escolhidos para mostrar a armadilha. Não são dados de ninguém. Servem para explicar o cálculo.

O que acontece entre a palavra aparecer e o dedo tocar

Antes das contas, vale saber o que está sendo cronometrado. Quando a palavra surge na tela, o cérebro percorre uma sequência de etapas — e cada uma tem seu momento aproximado, medido em décadas de estudos que combinam movimento ocular e eletroencefalograma.

0100200 300400500 600 ms a palavra aparece a palavra é identificada 100 a 200 ms o significado encaixa no contexto — é o N400 o dedo toca a tela só na leitura por botão na leitura natural, o olho já saiu da palavra aqui
Valores típicos para leitores adultos experientes. A linha do tempo do reconhecimento de palavras foi estabelecida combinando movimento ocular e potenciais evocados (SERENO; RAYNER; POSNER, 1998; SERENO; RAYNER, Trends in Cognitive Sciences, 2003).

Duas coisas que essa linha do tempo esclarece.

A primeira: o N400 não é um atraso, é um momento — e acontece em toda palavra, para todo mundo. O que muda entre uma palavra esperada e uma absurda não é a existência dele, e sim o tamanho da onda. Exatamente como o tempo: toda palavra leva tempo, e o que interessa é quanto a mais.

A segunda: a leitura por botão é mais lenta que a leitura natural. Lendo um texto normalmente, o olho já deixou a palavra por volta de 200 a 250 ms. No teste, o tempo chega perto de 500 ms porque inclui algo que a leitura natural não tem — a decisão de avançar e o movimento do dedo. Essa diferença é a razão de existir o sub-estudo com rastreamento ocular no projeto: ele mede o quanto o paradigma de botão se afasta da leitura de verdade.

E um cuidado com o nome, porque ele engana. "N400" não é um limiar de tempo. É o nome de uma onda: N de negativa, 400 do momento aproximado em que ela faz o pico. E ela tem duas dimensões, que convém não misturar:

As duas importam na clínica, porque a descrição no comprometimento cognitivo leve usa ambas: o efeito vem reduzido em amplitude e atrasado em latência.

O que é fácil embaralhar são duas coisas que dividem a mesma unidade e não são a mesma coisa: a latência do N400, em milissegundos, é quando o cérebro reage, medida por eletrodo; o tempo de leitura, também em milissegundos, é quanto a pessoa demorou para tocar a tela, medido por relógio. Evento cerebral e resposta comportamental.

No teste não existe piso nenhum. Palavra curta e fácil pode levar 300 ms, e está certo. E no eletroencefalograma também não existe "abaixo do N400": toda palavra produz onda naquele momento — pequena na esperada, grande na absurda. Compara-se a altura, nunca a existência.

Uma ressalva honesta: há debate na literatura sobre se o N400 reflete apenas integração posterior ao reconhecimento da palavra ou se começa antes, por volta dos 200 ms. Os marcos acima são aproximados e variam com idade, escolaridade e dificuldade do texto.

O caminho da palavra, dentro desses milissegundos

A linha do tempo acima diz quando cada coisa acontece. Falta dizer onde — e é aí que aparece o detalhe que torna o teste possível.

pão na tela 1 fóvea o único ponto da retina que enxerga o bastante para ler ~115 ms 2 occipital ainda é desenho ~150 ms 3 caixa de letras aqui vira palavra até ~400 ms 4 sentido + contexto pico do N400 cabeça de perfil, olhando para a esquerda
Marcos aproximados, para leitor adulto experiente. O olho está ampliado; na cabeça ele é o ponto claro à frente.
  1. A fóvea. A palavra na tela só é legível se cair na fóvea — uma região minúscula da retina, de cerca de dois graus, que é a única com resolução suficiente para distinguir letras. Fora dela a visão serve para saber que há algo escrito, não para ler o quê. É por isso que se lê movendo os olhos: para trazer cada palavra até esse pontinho.
  2. O córtex occipital. Por volta de 115 ms o sinal chega ao fundo da cabeça. E aqui está o ponto: ainda não é palavra. São traços, curvas, contraste, bordas — a mesma maquinaria que processaria um rosto ou uma árvore.
  3. A caixa de letras. Por volta de 150 ms o sinal alcança uma região embaixo e à esquerda, no sulco occipitotemporal, que Stanislas Dehaene apelidou de “caixa de letras do cérebro” — o nome técnico é área da forma visual da palavra. É aqui que aquilo vira uma palavra, e não antes. Essa região não nasce pronta: ela se especializa por causa da alfabetização.
  4. O sentido e o contexto. Só então o significado é evocado e confrontado com o que a frase vinha construindo. É esse confronto que produz o N400, com pico por volta de 400 ms.

Enquanto o sinal não chega à caixa de letras, não há palavra — há desenho. Tudo o que este teste mede acontece depois desse ponto, e por isso ele não é um teste de visão nem de reflexo: é um teste do que o cérebro faz com uma palavra depois de reconhecê-la.

Isso também explica por que a etapa 4 é a única que interessa aqui. As etapas 1, 2 e 3 custam praticamente o mesmo em toda palavra — “pão” e “tijolo” gastam o mesmo tanto para virar palavra. O que muda entre elas é só o último passo, o do encaixe no contexto. É exatamente ali que mora a inclinação em milissegundos por bit.

Fonte dos marcos e do apelido: DEHAENE, S.; COHEN, L. The unique role of the visual word form area in reading. Trends in Cognitive Sciences, 15(6), 254–262, 2011 — e o livro Os neurônios da leitura, do mesmo autor. Os tempos variam entre estudos e entre pessoas; o que é estável é a ordem.

O cálculo dos bits, passo a passo

Os bits não são atribuídos à mão. Antes de qualquer pessoa sentar para o teste, o modelo de linguagem lê a frase e responde, palavra por palavra: qual a chance de vir justo esta? A conta é uma só:

A fórmula bits = −log2(probabilidade que o modelo deu àquela palavra)

Bit é uma dobra

Imagine uma folha de papel que representa todas as palavras que poderiam vir a seguir naquele ponto da frase. A folha inteira é a dúvida completa: ainda pode ser qualquer coisa. Cada bit é uma dobra ao meio.

dobraso que sobra da folhaem bits
1metade1
2um quarto2
3um oitavo3
10cerca de um milésimo10
20cerca de um milionésimo20

Os bits de uma palavra são quantas dobras foram precisas para chegar até ela. Em “ela passou manteiga no ___”, o contexto já dobrou quase tudo: quando pão aparece, sobrou pouquíssimo papel — poucos bits, pouco tempo de leitura. Em “trocou o pneu com um ___”, a palavra pão exige dobrar muitas vezes até chegar nela — muitos bits, e você para para reler. É a mesma palavra nos dois casos: o que mudou foi o contexto, e só ele. É exatamente isso que o exame mede.

De onde sai o número

A mesma conta, contada de outro jeito — e aqui aparece de onde vem aquele 1.024 que sempre ronda essas explicações.

Pegue uma frase do próprio banco: “A menina passou manteiga no ___”. Imagine que, depois de no, coubessem 1.024 palavras diferentes, todas com a mesma chance. Uma delas é a certa, e você precisa descobrir qual fazendo apenas perguntas de sim ou não. A melhor pergunta é sempre a que corta a lista ao meio — e cada corte desses é um bit.

bitsainda podem ser
01.024 palavras
1512
2256
3128
532
84
92
101 — só pode ser pão

Dez cortes. Dez bits. É só isso que o 1.024 significa: dobrar dez vezes dá exatamente 1.024. O número não tem nada de especial — é só o que dá dez dobras.

Então, quando o exame mostra uma palavra com 10 bits, ele está dizendo: o modelo deu a essa palavra mais ou menos a mesma chance que teria uma escolhida entre 1.024 igualmente prováveis. Uma em mil.

bitsé como achar 1 entre
38
6,6100
101.024
13,310.000
201 milhão

É por isso que vinte bits não é o dobro de dez: é mil vezes mais improvável. E é por isso que a régua existe — sem ela seria preciso comparar 0,001 com 0,000001, e o olho não distingue os dois. Com ela, compara-se 10 com 20.

E aqui está por que a primeira palavra de cada frase é jogada fora da análise. Ela costuma aparecer com uns 19 bits — uma chance em 500 mil. Não porque a palavra seja difícil, mas porque ali, sem nenhuma palavra antes dela, o modelo está respondendo a outra pergunta: “com que palavra um texto qualquer do mundo começa?” — e nessa cabe o dicionário inteiro.

Aquele número não mede dificuldade de leitura, mede ausência de contexto. Por isso a primeira palavra sai da conta, em todas as frases e em todos os números desta tela.
Uma ressalva honesta sobre as duas imagens acima. Ninguém dobra nada, não existe folha e não existe lista de 1.024 palavras dentro da máquina. O modelo não vai cortando possibilidades passo a passo e não faz pergunta nenhuma: ele devolve uma chance — por exemplo, 0,00098.

As dobras e o 1.024 são só o jeito de dizer o tamanho dessa chance em palavras humanas: “deu mais ou menos uma em mil”. A lista de 1.024 é uma régua para você medir, e não uma coisa que exista dentro da máquina.

A dobra é a aritmética ficando visível, não um mecanismo. Ela serve para uma coisa só, e basta: fazer sentir por que um bit a mais é sempre metade, e não um pouquinho a mais.
E é assim que o N400 entra. O N400 é a reação elétrica do cérebro quando a palavra chega, e quanto mais dobras foram necessárias, maior a onda — Kutas e Hillyard mediram isso em 1984, e a amplitude é função inversa da probabilidade de completação.

Então bits e N400 medem a mesma coisa em unidades diferentes: os bits contam as dobras no texto, o N400 mede o susto em microvolts no cérebro. E este exame mede o mesmo susto em milissegundos, com um dedo. Três réguas, um fenômeno.

Mas a palavra não é medida inteira

Aqui está a parte que explica por que os números na tela são maiores do que se esperaria. O modelo não enxerga palavras: enxerga pedaços. Ele quebra o texto em unidades que nem sempre coincidem com palavras, calcula os bits de cada pedaço e soma.

Abaixo, a conta real das três versões da mesma frase do banco. Os números saíram do próprio modelo, não de exemplo inventado:

Versão e pedaçoschance que o modelo deubits
“…passou manteiga no pão.”
“ pão”1,0%  ·  1 em 996,63
“.”0,035%  ·  1 em 2.83111,47
soma18,1
“…passou manteiga no bolo.”
“ bolo”0,014%  ·  1 em 6.93512,76
“.”0,034%  ·  1 em 2.90211,50
soma24,3
“…passou manteiga no tijolo.”
“ tij”0,0002%  ·  1 em 456.95718,80
“olo”10,6%  ·  1 em 9,43,24
“.”0,031%  ·  1 em 3.20011,64
soma33,7

Esses 18,1, 24,3 e 33,7 são exatamente os números que aparecem em surpresa em bits. A tabela acima é de onde eles saem.

Duas coisas nessa tabela merecem atenção.

1. Repare no “olo”. A palavra tijolo foi partida em “tij” e “olo”. O primeiro pedaço custou 18,80 bits — uma chance em 457 mil. Já o segundo custou apenas 3,24, porque depois de “tij” o resto é quase obrigatório. É a previsão funcionando dentro da própria palavra, em miniatura, e pelo mesmo mecanismo que o teste mede na frase inteira.

2. Repare no ponto final. Ele custou 11,47, 11,50 e 11,64 bits — praticamente idêntico nas três versões. É um custo constante, que entra igual em todas e por isso desaparece no contraste entre elas. Sem o ponto, os alvos seriam 6,6 · 12,8 · 22,0 — e as diferenças continuariam as mesmas.

É a mesma lógica que faz o exame reportar a inclinação e não a velocidade: o que entra igual em tudo não atrapalha a comparação.

Por que os números são tão altos. O modelo usado é o bloom-560m, que é multilíngue e mal calibrado para o português: ele subestima palavras comuns e infla os bits. Isso não invalida a comparação — o que importa é a ordem e a distância entre as três versões, e essas se mantêm. Mas é a razão de a norma humana em complete a frase ainda precisar ser coletada: é ela que dirá se o modelo concorda com gente de verdade. Trocar por um modelo maior não resolve — ver Oh & Schuler na bibliografia.

1. Onde fica cada palavra, numa frase de verdade

Antes de qualquer conta, é preciso saber de que palavras se está falando — e não confundir as duas grandezas. Cada palavra tem dois números: os bits, que dizem o quanto ela era difícil de prever e são calculados pelo modelo antes de alguém ler; e os milissegundos, que dizem quanto tempo a pessoa gastou nela. Bits são do texto. Milissegundos são da pessoa.

Abaixo, duas frases iguais até o fim. Os bits foram medidos de verdade; os tempos são inventados, para a conta ficar visível.

linha de cima: BITS — dificuldade da palavra, do textolinha de baixo: MS — tempo gasto, da pessoaFRASE NORMAL19,417,17,714,98,510,520,613,313,6—540505590515575560520750Nahoradojantar,afamíliasentouàmesa.FRASE ABSURDA19,817,38,014,88,510,620,413,334,8—5505105805255655555301150Nahoradojantar,afamíliasentouànuvem.excluídasem contexto antesas 7 palavras do meiobits quase iguais · tempo quase iguala palavra final13,6 → 34,8 bits750 → 1150 ms
Repare que as sete palavras do meio custaram praticamente o mesmo nas duas frases — 543 e 545 ms. Tinha de ser assim: até a última palavra, as frases são idênticas.

Por que os números não são exatamente iguais? Porque ninguém faz duas vezes a mesma coisa no mesmo tempo: a atenção oscila, o dedo sai mais rápido ou mais devagar. São 5 a 10 ms de variação, sem direção — contra os 400 ms do efeito que se quer medir. É por isso que se usa a média: os erros para cima cancelam os para baixo.

E um aviso sobre o esquema: aqui as duas frases aparecem juntas para mostrar a estrutura. No estudo real ninguém lê as duas — pelo quadrado latino, cada participante vê cada frase-base uma única vez. A comparação continua dentro da mesma pessoa, mas entre frases diferentes: a média das finais das frases normais contra a média das finais das absurdas.

As três palavras que importam

NomeQuem éTempo
Palavras do meio As sete do miolo, da segunda à penúltima. A primeira fica fora porque não tem contexto antes dela. 543 ms em média
Palavra final simples "mesa" — a última palavra da frase normal. É o que se espera depois de "a família sentou à". 750 ms
Palavra final difícil "nuvem" — a última palavra da frase absurda. Mesma posição, mesma frase até ali. 1150 ms

As três contas, com estes números

Fechamento de frase — quanto custa amarrar o sentido palavra final simples − palavras do meio
750 − 543 = +207 ms

Esses 207 ms não têm nada a ver com significado estranho: "mesa" é a palavra esperada. É o preço de fechar a frase, e ele aparece em toda frase que termina.

Custo da incongruência — a conta certa palavra final difícil − palavra final simples
1150 − 750 = +400 ms

As duas são finais, então o fechamento está nas duas e se cancela. O que sobra é o estranhamento — e é só isso que se quer medir.

A conta errada palavra final difícil − palavras do meio
1150 − 543 = +607 ms

Aqui os 400 ms de estranhamento vieram somados aos 207 do fechamento. Dois efeitos diferentes, um número só — e o número maior parece um resultado melhor, o que torna o erro ainda mais perigoso.

Regra para não errar: compare sempre coisas que ocupam a mesma posição na frase. Final com final, meio com meio.

2. Dois leitores, uma tabela só

São as mesmas duas frases da seção anterior — a da "mesa" e a da "nuvem" —, agora lidas por duas pessoas diferentes. Todos os números daqui para a frente saem desta tabela. Nenhum aparece do nada.

PalavrasurpresaSaudávelCom CCL
as do meio, em média—550 ms800 ms
última: "mesa", a esperada14 bits750 ms1100 ms
última: "nuvem", a absurda35 bits1150 ms1200 ms

Olhe a última linha: na palavra absurda os dois ficam quase juntos, 1150 contra 1200 ms. Se você olhasse só esse número, diria que são praticamente iguais. Agora olhe a linha de cima: na palavra esperada eles estão a 350 ms de distância.

Repare também na primeira linha, a das palavras do meio: 550 ms contra 800. A pessoa com comprometimento é mais lenta em geral, e não apenas na palavra difícil. Isso não é suposição desta página: Fernández e colaboradores (2014) relatam pacientes com Alzheimer leve mais lentos na leitura de modo geral, além de a previsibilidade da palavra não encurtar o olhar deles como encurta o dos controles pareados.

São, portanto, dois efeitos somados: a reta inteira sobe (a lentidão geral) e o ângulo dela achata (a previsão que deixou de descontar). O exame reporta a inclinação justamente porque ela é o segundo efeito sem o primeiro — a lentidão desloca a reta e não muda o ângulo. Ver a referência completa na bibliografia.

Os dois perfis não têm o mesmo estatuto. O saudável está próximo do que este instrumento já registrou em adulto sem queixa — velocidade média entre 539 e 671 ms por palavra. O perfil com CCL é hipótese: não existe dado publicado de inclinação em comprometimento cognitivo leve, aqui ou em lugar nenhum. Mais lento, mais plano e com menos reação ao absurdo é a forma que a hipótese prevê. Medir esses números é o objetivo do trabalho.

3. As três contas, todas da mesma tabela

Custo da incongruência — alvo contra alvo Saudável: 1150 − 750 = +400 ms
Com CCL: 1200 − 1100 = +100 ms

As duas são a última palavra da frase, então o fechamento está nos dois lados e se cancela. O saudável estranhou o absurdo em 400 ms; o outro, em 100 — quatro vezes menos. Ele já gastava 1100 ms na palavra esperada.

Fechamento de frase — última contra as do meio Saudável: 750 − 550 = +200 ms
Com CCL: 1100 − 800 = +300 ms

Note que "mesa" é a palavra esperada — não há estranheza nenhuma aqui. Esses milissegundos são só o preço de amarrar o sentido da frase, e aparecem em toda frase que termina.

A conta errada — alvo contra as palavras do meio Saudável: 1150 − 550 = +600 ms
Com CCL: 1200 − 800 = +400 ms

Aqui a incongruência veio somada ao fechamento. Dois efeitos diferentes num número só — e o número maior parece um resultado melhor, o que torna o erro ainda mais perigoso.

4. A inclinação, das mesmas duas palavras

"Mesa" tem 14 bits de surpresa e "nuvem" tem 35. Entre uma e outra vão 21 bits de distância. A inclinação é a diferença de tempo dividida por essa distância:

Saudável de 750 a 1150 ms → 400 ms ÷ 21 bits = 19.0 ms/bit
Com CCL de 1100 a 1200 ms → 100 ms ÷ 21 bits = 4.8 ms/bit

De onde vêm estes dois números. Os tempos de 750, 1100, 1150 e 1200 ms são um exemplo de aula: foram escolhidos redondos para a conta caber de cabeça. Não são medida de ninguém, e não existe ponto de corte publicado que separe 19,0 de 4,8. A medida real que já foi feita — uma sessão, um adulto sem queixa, no toque — deu 13 ms/bit, e é ela que aparece em /inclinacao e em /voz × toque. Um número menor que o do exemplo não quer dizer nada: a régua ainda não existe, e construí-la é justamente o objetivo do estudo.

1100 ms 900 700 "mesa" · 14 bits "nuvem" · 35 bits surpresa da palavra → 350 ms de distância só 50 ms — mas nunca zero com CCL 4.8 ms/bit saudável 19.0 ms/bit tempo na palavra →
As duas retas ligam os mesmos dois pontos da tabela. Elas nunca se encontram: a vermelha fica acima da verde do começo ao fim. O que muda é a distância entre elas — larga na palavra esperada, estreita na absurda.

Na palavra absurda os dois gastam quase o mesmo: 1150 contra 1200 ms. Na palavra esperada, 750 contra 1100. A diferença não some no extremo difícil — ela encolhe.

Por que a reta vermelha não encosta na verde nem na palavra mais difícil.

Porque quem gasta 1100 ms numa palavra fácil é lento em geral — e lentidão geral não escolhe hora para aparecer. Ela vem junto em toda palavra. Para as duas retas se encontrarem no extremo difícil, esse leitor teria de parar de ser lento exatamente na palavra mais difícil da frase, e não há razão nenhuma para isso.

Pense em dois carros. O rápido anda a 750 no plano e cai para 1150 na subida — sentiu bastante. O devagar já anda a 1100 no plano e cai para 1200 — quase não sentiu. O carro devagar nunca alcança o rápido, nem na subida, porque é devagar em toda parte.

São dois efeitos somados, e cada um mexe num lugar da reta: a falta de previsão deita a reta (muda o ângulo) e a lentidão geral levanta a reta (muda a altura). Fernández encontrou os dois nos mesmos pacientes. Só o primeiro é a hipótese deste trabalho — o segundo qualquer coisa produz, e é por isso que o número principal é o ângulo, nunca a altura.

O que está publicado é o ângulo, não a altura. Fernández et al. (2014) mostraram que a previsibilidade deixa de encurtar o tempo no comprometimento — a reta achata. A altura de cada reta, e portanto a distância exata entre elas, ninguém mediu em comprometimento cognitivo leve. Os 350 e os 50 ms deste desenho ilustram a forma, não um resultado. Ver a economia.

O saudável não é melhor em lidar com o difícil. Ele é melhor em economizar no esperado (por que o desconto é na palavra fácil). Esse desconto é o que a previsão entrega — e é ele que some no comprometimento, quando a pessoa passa a pagar preço cheio em tudo.

Duas ressalvas sobre esta conta, para ela não ser mal usada.

Primeira: aqui a inclinação saiu de duas palavras, para o cálculo ficar visível. No teste de verdade ela sai das 20 palavras que fecham frase — passa-se uma reta por essas vinte, e não por duas. Duas palavras é pouquíssimo: numa leitura real, tirar uma única delas mudou o resultado de 13 para 31 ms/bit.

Segunda: as duas palavras usadas são finais, e é por isso que a conta funciona — o fechamento de frase está nas duas e se cancela. Mas elas são as duas pontas da faixa de dificuldade, e as pontas exageram: a inclinação sai mais alta do que a reta ajustada às vinte. Na leitura de 30/08 as pontas deram 53,7 e as vinte deram 30,9. É o suficiente para explicar o conceito, não para reportar num artigo.

O que a máquina faz de verdade

A conta acima é ilustração, não é o cálculo. Ela existe para mostrar o que uma inclinação é, com duas palavras e números redondos. Duas palavras nunca dariam uma medida confiável — uma delas pode ter pegado a pessoa distraída, e pronto, o resultado muda.

O que o exame faz é usar todas as palavras de uma vez. Cada palavra vira um ponto: para a direita, quantos bits ela tinha; para cima, quantos milissegundos a pessoa levou nela. No conjunto 1 são 158 pontos; no conjunto 2, 149.

Depois o computador pousa uma régua sobre essa nuvem e a gira até ficar o mais perto possível de todos os pontos ao mesmo tempo. A inclinação dessa régua é o resultado. Não é fácil menos difícil: é quanto a régua sobe a cada bit, ao longo da faixa inteira.

A régua tem duas propriedades, e só uma interessa. A altura onde ela começa é a velocidade de base da pessoa — todo mundo é lento por algum motivo. A inclinação é a resposta à dificuldade. É a mesma diferença entre a frequência cardíaca em repouso e a resposta à esteira.

E um desconto que a régua precisa fazer

Há um detalhe que, sem tratamento, faria a régua mentir para cima.

As palavras que terminam frase são lentas por dois motivos somados: a surpresa e o custo de fechar o sentido — aqueles +180 ms que aparecem como “fechamento de frase” na tela. E, no banco, elas se concentram no lado difícil:

na lista C do conjunto 1quantassurpresa média
palavras do meio13813,6 bits
palavras finais2023,7 bits

Entre as 20 palavras mais difíceis da lista, 11 são finais de frase. Entre as 20 mais fáceis, nenhuma. Como pontos no extremo puxam mais a régua que pontos no meio, esse punhado de finais levantaria a ponta direita — e parte do custo de fechamento seria creditada à dificuldade.

Por isso a conta mede onde o efeito de fechamento se cancela sozinho. A inclinação do exame sai só das palavras que fecham frase — e todas elas carregam o custo de fechamento, nas três versões. Comparando final com final, esse custo entra igual dos dois lados e some da subtração, exatamente como no exemplo das duas palavras acima. Não é preciso descontar nada.

Até 30/08/2026 o exame fazia diferente, e errado: ajustava uma reta única a todas as palavras e descontava a posição por regressão. O problema é que o peso de cada palavra nessa conta é proporcional à variação de dificuldade que ela carrega — e as palavras do meio, por serem quase 180 contra 20, levavam de 91% a 96% do peso. Ou seja: o resultado era decidido quase inteiramente por palavras cuja dificuldade ninguém escolheu. Medido nas sessões reais, o meio subia 1,58 ms/bit e as finais 44,89 — e o número reportado, 4,24, não descrevia nenhum dos dois.

É o mesmo procedimento que Fernández usou — ele tratou os dados com modelo misto justamente para separar efeitos que chegam juntos. Ver bibliografia.

E por que não tirar as palavras difíceis do meio da frase?

Porque elas estão lá de propósito. Se a dificuldade aparecesse apenas na última palavra, o participante — sobretudo o mais escolarizado — aprenderia o padrão em poucas frases: “a estranha é sempre a última”. E passaria a antecipar, o que destrói a manipulação.

Dificuldade espalhada pela frase mantém o teste cego. E ela não estraga a conta porque a conta não passa por ali: a inclinação sai só das palavras que fecham frase, onde as três versões se comparam entre si. As palavras difíceis do meio ficam no texto para enganar quem lê, e ficam fora do cálculo — em vez de escolher entre um e outro, fica-se com os dois.

Elas ainda servem para duas coisas na tela: o fechamento de frase, que compara as finais com as do meio e diz se houve leitura de verdade, e a decomposição da conferência, que mostra as duas inclinações lado a lado. O que elas deixaram de ser é o resultado.

Um exemplo concreto de que a dificuldade não mora só no fim: na lista C, a palavra mais difícil de todas é “encheu”, com 40,1 bits — no meio de “Com muita sede, o menino encheu o copo de…”. Ela é mais imprevisível que qualquer final absurdo da lista, porque ali o contexto ainda não estreitou nada: podia ser bebeu, pediu, pegou, quis. Já no fim da frase, mesmo o absurdo chega com o caminho meio fechado.

Por que o exame devolve um número menor que este

Atenção, porque isso confunde e alguém vai perguntar. A conta acima dá 19,0 ms/bit para o leitor saudável. Mas uma sessão real de adulto sem queixa, medida por este instrumento, devolveu 4,38 ms/bit. Não é contradição nem erro: são duas grandezas diferentes que levam o mesmo nome.
o exemplo desta páginao que o exame calcula
usa2 palavras20 palavras
quaisas duas extremas, ambas finais de frase, uma delas a incongruenteas 20 finais de frase, uma por frase, cobrindo a faixa toda
posição na frasenão precisa descontar — as duas são finais, e o efeito se cancelanão precisa descontar — todas são finais, e o efeito se cancela
resultado típico19,031 a 55

O contraste entre dois extremos é sempre maior que a média do caminho todo. É a mesma coisa de comparar a subida mais íngreme de uma estrada com a inclinação média dela: o trecho mais duro sobe muito mais que o percurso inteiro, e nenhum dos dois números está errado.

Some a isso que uma das duas palavras do exemplo é a incongruente — o contraste mais forte que o material produz. Ela não representa a palavra média de uma frase; ela é o extremo construdo de propósito.

Qual citar: o do exame. Os 19,0 e 4,8 desta página existem para ensinar o que é uma inclinação, com números redondos que cabem de cabeça. Nunca compare o resultado de uma pessoa com eles. Compare com outras pessoas medidas pelo mesmo exame — que é justamente a norma que ainda não existe.

E não compare com os 13 ms/bit das primeiras sessões. Aqueles eram brutos, sem descontar a posição na frase. O mesmo teste que devolveu 4,38 devolveu 12,75 sem descontar — ou seja, a série histórica bruta está estável (13 → 11 → 12,75). Comparar bruto com corrigido é o erro fácil de cometer aqui.

5. Como se calcula a inclinação?

As seções acima usaram duas palavras, para o mecanismo ficar visível. Esta usa as vinte — que são as últimas palavras de cada frase, absurdas ou não. É o que o exame faz de verdade.

O exame tem vinte frases, e cada uma termina numa palavra que pode ser esperada, possível ou absurda. Cada participante lê uma das três versões de cada frase, então sai da leitura com vinte últimas palavras: umas esperadas, umas possíveis, umas absurdas. São essas vinte que entram na conta — todas elas, e não só as absurdas. É justamente a mistura de fáceis e difíceis que permite traçar uma reta: com só as absurdas não haveria dificuldade variando, e sem variação não há inclinação.

Por que só as últimas? Duas razões. Primeira: são as únicas cuja dificuldade foi escolhida de propósito — nas outras, a dificuldade é a que a frase por acaso tinha. Segunda: toda última palavra carrega o custo de fechar o período, e como as três versões terminam na mesma posição, esse custo entra igual em todas e se cancela na comparação. As outras 176 palavras lidas ficam de fora do cálculo.

Os números abaixo são de uma sessão real: código ARA-FZPW, 31 de agosto de 2026, lista C. Nada aqui é exemplo inventado, e cada peça da conta está explicada antes de aparecer.

Passo 1 — achar o centro

Primeiro se pergunta: qual foi a dificuldade média, e qual foi o tempo médio? Somam-se os vinte valores de cada coluna e divide-se por vinte.

x̄ = 26,94 bits — a dificuldade média das vinte palavras. Lê-se “x barra”; a barra em cima significa média.
ȳ = 953,65 ms — o tempo médio gasto nelas.

Esses dois números são só o ponto de referência. A inclinação não sai deles — sai de como as palavras se afastam deles.

Passo 2 — medir o afastamento de cada palavra

Para cada uma das vinte, calculam-se duas distâncias:

Por que centrar em vez de usar os valores crus? Porque o que interessa não é se a pessoa gasta 900 ou 400 ms — isso é a velocidade dela. Interessa se, quando a palavra fica mais difícil que o comum, o tempo também sobe acima do comum. Centrar tira a velocidade da conta e deixa só a variação.

Passo 3 — o produto: o voto de cada palavra

Multiplicam-se as duas distâncias. É aqui que cada palavra dá o seu voto, e o sinal do produto diz o que ela votou:

Passo 4 — a tabela inteira

palavra x
bits
y
ms
x − x̄
dificuldade
y − ȳ
tempo
produto
o voto
(x − x̄)²
o peso
cabelo13,7856-13,24-98,11298,2175,30
forno14,8801-12,14-153,11858,0147,38
atender19,81023-7,1468,9-492,350,98
linguiça20,6600-6,34-353,52241,540,20
francês22,4610-4,54-343,71560,620,61
manga22,6959-4,345,8-25,018,84
máquina23,7617-3,24-336,21089,410,50
sabão24,1976-2,8422,2-62,98,07
preta24,7563-2,24-390,9875,75,02
óleo24,8592-2,14-361,7774,14,58
corredor25,2733-1,74-220,9384,53,03
pano27,87830,86-171,0-147,10,74
pente29,39112,36-42,8-101,15,57
esterco29,67922,66-162,0-430,87,08
bronze32,015695,06615,43114,225,60
pensamento32,715045,76550,53171,233,18
envelope33,711306,76176,71194,245,70
arco-íris34,012087,06254,31795,749,84
vampiro41,4193614,46982,014200,4209,09
raposa41,991214,96-41,7-624,6223,80
somas Sxy = 31674,01Sxx = 1085,09

As duas linhas coloridas mostram os extremos. Em verde, “vampiro”: 41,4 bits e 1936 ms — muito acima da média nas duas coisas, produto de +14200,4, o maior voto a favor da tabela. Em vermelho, “raposa”: foi a palavra mais difícil das vinte (41,9 bits) e mesmo assim ele a leu em 912 ms, abaixo da média. Produto de -624,6 — ela vota contra, e puxa a inclinação para baixo.

Isso é normal e é a razão de se usarem vinte: nenhuma palavra decide sozinha. Com duas, uma hesitação mandaria no resultado inteiro.

Passo 5 — as duas somas

Sxy = 31674,01 — a soma de todos os votos. É o quanto, no conjunto, o tempo acompanhou a dificuldade. Se as palavras discordassem entre si, os positivos e negativos se cancelariam e esta soma ficaria perto de zero.

Sxx = 1085,09 — a soma dos pesos, ou seja, o quanto a dificuldade variou. Se as vinte palavras tivessem dificuldade parecida, este número seria minúsculo, e não haveria de onde tirar inclinação nenhuma. É a alavanca da medida.

Passo 6 — a inclinação

b = Sxy ÷ Sxx
b = 31674,01 ÷ 1085,09
b = 29,1903 ms/bit

A divisão é o que torna o número comparável. O Sxy sozinho depende de quantas palavras entraram e do quanto elas se espalharam; dividindo pelo espalhamento, sobra quanto tempo por unidade de dificuldade — um preço por bit, que se compara entre pessoas que leram frases diferentes.

É esse o número grande da tela do exame, e ele quer dizer: a cada bit a mais de dificuldade, esta pessoa gastou 29,1903 milissegundos a mais.

Passo 7 — onde a reta começa

A inclinação diz a subida, mas não diz a altura. Para desenhar a reta falta o ponto de partida, que sai das médias:

a = ȳ − b × x̄
a = 953,65 − 29,1903 × 26,94 = 167,26 ms

a reta:  ms = 167,26 + 29,1903 × bits

A dificuldade das vinte foi de 14,8 a 41,9 bits. Sobre a reta, isso vai de 599 ms na palavra mais fácil a 1390 ms na mais difícil — uma subida de 791 ms. É a mesma inclinação dita em milissegundos em vez de por bit, e é o número que a tela mostra logo abaixo do resultado.

Passo 8 — o quanto se pode confiar

A reta não passa por cima dos vinte pontos: cada um fica um pouco acima ou abaixo dela. Essa sobra é que diz se a inclinação é firme ou frouxa.

SSE = Σ(y − a − b·x)² = 1603763
gl  = n − 2 = 20 − 2 = 18
s²  = SSE ÷ gl = 89097,9
erro-padrão de b = √(s² ÷ Sxx) = 9,0615

margem = 2,101 × 9,0615 = ±19,04
faixa de 95%:  10,15 a 48,23 ms/bit

A faixa é larga, e a tela diz isso. A margem é 65% da estimativa. Ela não alcança o zero, então o exame pode afirmar que o efeito existe nesta leitura — mas não pode afirmar o tamanho dele nesta pessoa.

Pela fórmula acima, a margem cai com 1 ÷ (espalhamento × √n). Com vinte palavras críticas é o que dá; para chegar a um terço da estimativa seriam necessárias cerca de 77 — vinte minutos de leitura seguida, que não se pede a um idoso com queixa de memória. É por isso que o instrumento compara conjuntos de pessoas, e não mede indivíduo.

Esta mesma conta pode ser refeita com a sua própria leitura, em cinco frases em vez de vinte, em /teste3 — a página mostra as parcelas uma a uma e confronta o resultado com o módulo que o exame usa. Na tela do exame ela aparece em “a conta aberta, parcela por parcela”.

6. Por que dividir pela distância

Porque a diferença sozinha depende de quais duas palavras você comparou. Veja o mesmo leitor saudável, com pares diferentes — os tempos saem da reta dele, de 19 ms por bit:

par de palavrastemposdiferençadistânciaconta
14 e 21 bits750 → 883 ms133 ms7 bits133 ÷ 7 = 19
21 e 35 bits883 → 1150 ms267 ms14 bits267 ÷ 14 = 19
14 e 35 bits750 → 1150 ms400 ms21 bits400 ÷ 21 = 19

A diferença muda toda vez — 133, 267, 400. A inclinação dá 19 sempre.

É a diferença entre olhar o valor da conta e olhar o preço por quilo. O valor da conta depende de quanto você levou. O preço por quilo é do produto.

7. Por que isso importa no estudo

Participantes em listas diferentes leem palavras diferentes. Comparar diferenças brutas seria comparar pares de palavras que nem são os mesmos. Dividindo pela distância em bits, o número passa a pertencer à pessoa — e duas pessoas que leram frases diferentes ficam comparáveis.

Uma observação sobre a tela do teste. Ali a inclinação não vem de duas palavras: vem das 20 que fecham frase. Passa-se uma reta por essas vinte, e a inclinação dessa reta é o número. As duas palavras foram usadas aqui só para mostrar o que ele significa — e são as duas pontas, que exageram: numa leitura real elas deram 53,7 contra os 30,9 das vinte.

8. Como ler o gráfico do resultado

É o gráfico de pontos que aparece no fim do teste. Cada elemento dele quer dizer uma coisa:

O que você vêO que é
Cada bolinhaUMA palavra que você leu. Não é uma frase, não é uma pessoa. Se leu 160 palavras, há 160 bolinhas.
Posição na horizontalO quanto aquela palavra era surpreendente, em bits. Mais à direita = mais inesperada. Calculado antes de você ler.
Posição na verticalQuanto tempo você gastou naquela palavra. Mais para cima = demorou mais.
Bolinha verdePalavra comum da frase.
Bolinha vermelhaA palavra-alvo das frases incongruentes — o "tijolo" de "manteiga no tijolo".
A linha azulA reta que passa pelo meio da nuvem. É o resumo de todas as bolinhas em um traço só.
A inclinação da linhaÉ o custo preditivo em ms/bit. Sobe muito = a dificuldade pesa. Deitada = tanto faz a palavra ser fácil ou difícil.
Onde a linha começaÀ esquerda, sua velocidade de base: quanto você gasta numa palavra sem dificuldade nenhuma.
Quanto as bolinhas grudam na linhaÉ o acoplamento. Coladas = medida confiável. Espalhadas = pouco confiável.

O que procurar, nesta ordem

A linha sobe? Se sobe, o tempo acompanha a dificuldade e a previsão está trabalhando. Se está deitada, a palavra impossível custou o mesmo que a óbvia.

As vermelhas estão à direita e em cima? É onde deveriam estar: palavra absurda é surpreendente (direita) e deveria custar caro (em cima). Vermelha lá embaixo quer dizer que aquele item não incomodou.

Tem alguma bolinha sozinha, muito longe das outras? Um ponto extremo sozinho puxa a reta inteira. Pode ser uma distração, um espirro, alguém falando na sala. Vale olhar o gráfico antes de acreditar no número.

O que o gráfico NÃO mostra. Ele não separa as frases: bolinhas de frases diferentes ficam misturadas. E uma bolinha sozinha não significa nada — só o conjunto tem sentido, porque a medida é a distância entre valores, nunca um valor isolado.

9. Em que velocidade se lê num teste como este

Milissegundos por palavra é uma unidade pouco intuitiva. Convertida em palavras por minuto, ela ganha uma régua conhecida — a das cinco marchas de leitura descritas por Ronald Carver na teoria do rauding.

MarchaPara quêppmms/palavra
1 · memorizardecorar detalhes, texto difícil138435
2 · aprenderestudar conceito novo200300
3 · raudingleitura normal, com compreensão300200
4 · skimmingvisão geral — compreensão despenca450133
5 · scanningcaçar uma palavra específica600100

Repare na marcha 3: 300 palavras por minuto são 200 ms por palavra — exatamente a duração de fixação que a linha do tempo lá em cima traz para a leitura natural. Duas literaturas independentes chegando ao mesmo número.

E onde cai o teste

Sessão medidams/palavrappm
primeira, banco antigo67189
lista A60599
lista C565106
lista B539111

Todas abaixo da marcha 1. O teste roda mais devagar que a leitura mais lenta que Carver descreve — e isso não é defeito de quem lê.

É o paradigma. Tocar a tela a cada palavra insere uma decisão motora que a leitura natural não tem, e ela custa uns 300 ms por palavra. É o preço da resolução: lendo naturalmente a 300 ppm, não há como atribuir tempo a palavras individuais sem um rastreador de olhos. Forçando uma palavra por vez, compra-se essa atribuição e paga-se com naturalidade.

Consequências para o método, e vale escrevê-las na tese. Primeira: os valores em ms/palavra deste teste não são comparáveis a medidas de velocidade de leitura natural — são outra tarefa. Segunda: é exatamente esse desvio que o sub-estudo com rastreamento ocular vai dimensionar. Terceira: como a medida principal é a inclinação, e não a velocidade, o desvio entra como constante e não a contamina.

Uma ressalva de uso: a teoria das marchas é conhecida e bem citada, mas não é o modelo dominante na psicolinguística, que trabalha com modelos de movimento ocular. Serve bem como régua de faixas de velocidade; a base teórica deste trabalho continua sendo a codificação preditiva.

CARVER, R. P. Reading rate: theory, research, and practical implications. Journal of Reading, 1992.

10. Em uma frase

Um valor sozinho — 1150 ms na palavra absurda, 900 ms na difícil — não separa ninguém. Quem separa é sempre a distância entre dois números da mesma pessoa.