As IA citam os documentos PDF?
Publicado em
Raramente, em comparação com as páginas web. No ChatGPT, os PDF representam 16 a 21% dos resultados obtidos pelas suas pesquisas, mas são citados 2 a 5 vezes menos frequentemente do que as outras páginas, em todos os nossos corpus. O Claude traz muito poucos PDF, cerca de 3% dos seus resultados, no máximo. Não encontramos nenhum estudo publicado que meça a citação de PDF pelas IA: estes números são os nossos. Um documento importante publicado apenas em PDF tem, portanto, menos hipóteses de ser citado do que uma página web equivalente.
Para que tipo de pergunta? Tudo depende da pergunta. Se o utilizador procura um documento específico, uma norma, uma ficha técnica ou um relatório, a IA pode ir procurá-lo em PDF. Numa pergunta de informação ou de mercado, ela cita preferencialmente páginas web.
O que medimos no ChatGPT
Contamos, nos resultados obtidos pelas pesquisas do ChatGPT, os endereços de documentos PDF e, em seguida, a proporção desses documentos efetivamente citados. Os PDF são numerosos no que o ChatGPT encontra: 21% des resultados numa dezena de setores em francês, 20% nesses setores em inglês, 19% na resolução de problemas de software, 17% nas nossas perguntas sobre a visibilidade nas IA.
No entanto, são pouco citados: 5,7% dos PDF obtidos contra 12,1% das outras páginas nos setores em francês, 5,2% contra 10,1% em inglês, 4,9% contra 11,8% na resolução de problemas, e 2,1% contra 10,8% nas nossas perguntas de 15 de setembro de 2026. Um PDF é, portanto, citado 2 a 5 vezes menos frequentemente do que uma página web encontrada pela mesma IA. Os nossos primeiros corpus, sobre o setor de HVAC e inteligência artificial, já mostravam uma diferença de 3 a 4 vezes.
O Claude traz muito poucos PDF
No Claude, os PDF estão quase ausentes dos resultados: entre 0,5 e 3% do que a sua pesquisa traz, dependendo do corpus. É muito pouco para medir uma taxa de citação confiável. A diferença em relação ao ChatGPT deve-se, portanto, antes de mais, ao que cada motor de busca devolve, antes mesmo da escolha das fontes a citar.
No Gemini, a API não distingue as páginas encontradas das páginas citadas e fornece apenas o domínio das fontes, o que impossibilita a medição da proporção de PDF. Mais uma vez, uma regra única para «as IA» não é possível: o ChatGPT encontra muitos PDF e descarta-os, o Claude encontra poucos.
Por que um PDF é menos citado
Observamos vários obstáculos, sem podermos dizer qual deles pesa mais. Um PDF muitas vezes não tem uma tag de título utilizável, nem uma estrutura de parágrafos legível por máquina: nos nossos próprios levantamentos, alguns PDF foram lidos como um único bloco de texto de dezenas de milhares de palavras, e outros não puderam ser lidos de todo. No entanto, o trecho citado por uma IA é um parágrafo desenvolvido, identificável, que retoma as palavras da sua pesquisa.
Um PDF também costuma ser longo e generalista, como um relatório anual, guia completo, catálogo, quando a IA procura um trecho que responda a uma pergunta específica. Estas explicações continuam a ser hipóteses: medimos a diferença de citação, não a sua causa.
O que dizem o Google e os estudos publicados
O Google indexa os documentos PDF: o formato consta na lista de tipos de arquivos que pode indexer, atualizada em 3 de fevereiro de 2026. E a sua documentação sobre as funcionalidades de IA indica que uma página indexada e elegível para um trecho pode servir como fonte, sem requisitos adicionais. Nada exclui, portanto, um PDF das respostas de IA do Google.
Não encontramos nenhum estudo publicado, nem qualquer documentação da OpenAI, Anthropic ou Google, que trate especificamente da citação de PDF pelas IA. Este é um dos temas sobre os quais as nossas medições são, até onde sabemos, as únicas disponíveis.
O que isso muda para uma empresa
Un livro branco, uma ficha técnica ou um estudo publicados apenas em PDF são encontrados, mas raramente citados. Para que um conteúdo importante possa ser aproveitado por uma IA, é melhor publicá-lo também como página web, dividido em páginas ou seções que respondam cada uma a uma pergunta específica, com parágrafos desenvolvidos, mantendo o PDF disponível para download.
A página web traz a pergunta no seu título e endereço, responde logo nas primeiras linhas e remete para o documento completo. O PDF continua a ser útil para o leitor que deseja ler tudo; a página web é o que a IA pode citar.
O que não sabemos
Um documento é contabilizado como PDF quando o seu endereço termina em «.pdf»; um PDF disponibilizado sob outro endereço não é contabilizado. No ChatGPT, os documentos citados são identificados nos links da resposta. As nossas medições baseiam-se na API dos modelos e não distinguem os tipos de PDF.
Fontes
- Google Search Central — tipos de arquivos indexáveis pelo Google, .
- Google Search Central — «AI features and your website», .
- Medições FaireDuBruit, de 4 a 16 de setembro de 2026 — ver « Como medimos ».
Perguntas relacionadas
- Qual trecho de uma página uma IA cita?
- As IA preferem os conteúdos recentes?
- A marcação schema.org é necessária para ser citado pelas IA?
- O título de uma página conta para ser citado por uma IA?
Todas as perguntas sobre a visibilidade nas IAs · Nossa oferta