Extrair dados não tabulados de PDF

23 views
Skip to first unread message

Hugo Nicolau Barbosa de Gusmão

unread,
Dec 10, 2015, 5:22:35 PM12/10/15
to Transparência Hacker
Estou elaborando alguns mapas sobre a desigualdade na USP a partir dos relatórios socioeconômicos da FUVEST e estou encontrando algumas dificuldades para extrair os dados, o problema é que a FUVEST só disponibiliza os dados em PDF e "dentro" do PDF os arquivos não estão em tabelas e sim da seguinte forma:

 Qual o grau de instrução mais alto que seu pai obteve ?
0.5% - Não frequentou escola:  17
4.1% - Iniciou o ensino fundamental, mas abandonou entre a 1ª e a 4ª série  : 135
5.5% - Iniciou o ensino fundamental, mas abandonou entre a 5ª e a 8ª série  : 182
3.3% - Ensino Fundamental completo (1ª a 8ª series)  : 110
[...]

Eu testei o Tabula e vi que ele não serve nesse caso, existe alguma maneira de extrair os dados desse PDF e passar para planilhas que não seja copiando e colando?
Segue um relatório socioeconômico da Fuvest http://www.fuvest.br/vest2011/download/qase_inscr_car.pdf eu só precisaria do nome da carreira e do resultado de algumas perguntas.

Obrigado

Hugo Nicolau Barbosa de Gusmão
https://desigualdadesespaciais.wordpress.com/
 

Vitor Baptista

unread,
Dec 11, 2015, 3:58:41 PM12/11/15
to thac...@googlegroups.com
Oi Hugo,

Nesses casos, costumo usar o "pdftotext". Basta usar no terminal "pdftotext <nome-do-arquivo.pdf>" que ele já converte pra texto, daí você precisa ver como ficou a conversão e trabalhar na limpeza dos dados. As vezes conseguimos resultados melhores usando "pdftotext -layout <nome-do-arquivo.pdf>", que diz para o programa tentar manter o layout.

Estou enviando o PDF convertido para texto das duas formas (com e sem "-layout"). Dá uma olhada.

Abraços,
Vitor.

--
Você recebeu essa mensagem porque está inscrito no grupo "Transparência Hacker" dos Grupos do Google.
Para cancelar inscrição nesse grupo e parar de receber e-mails dele, envie um e-mail para thackday+u...@googlegroups.com.
Para postar nesse grupo, envie um e-mail para thac...@googlegroups.com.
Acesse esse grupo em http://groups.google.com/group/thackday.
Para ver essa discussão na Web, acesse https://groups.google.com/d/msgid/thackday/aadee3ea-9f1b-45e8-a996-5e3f2476c44e%40googlegroups.com.
Para mais opções, acesse https://groups.google.com/d/optout.



--
qase_inscr_car.tar.bz2

Pedro Markun

unread,
Dec 11, 2015, 7:09:45 PM12/11/15
to thackday
Nesse caso específico acho que da pra converter pra html e/ou xml (bati o olho aqui no xml e me parece a coisa mais sussa, só usar a flag -xml no pdftohtml ) e conseguir alguma consistência.
Sebemque o trabalho vai ser quase o mesmo de parsear o texto.

Marcos Santos da Silva

unread,
Jan 9, 2016, 11:54:30 AM1/9/16
to Transparência Hacker
A solução mais aproximada para o problema que também já enfrentei/enfrento foi o software ChronoScan: http://www.chronoscan.org/
Reply all
Reply to author
Forward
0 new messages