ProPublica e o inferno dos dados em PDF

7 views
Skip to first unread message

Daniel Bramatti

unread,
Mar 26, 2013, 8:57:11 PM3/26/13
to thac...@googlegroups.com

http://www.propublica.org/nerds/item/heart-of-nerd-darkness-why-dollars-for-docs-was-so-difficult

.

.

Daniel Bramatti | Editoria Nacional - Estadão Dados - Blog Públicos | O Estado de S. Paulo

Av. Eng. Caetano Álvares, 55 - Limão - São Paulo - SP - 02598-900

+ 55 11 3856-4592

estadoQuer  Blog Públicos Estadão Dados

image002.jpg

Pedro Markun

unread,
Mar 26, 2013, 9:14:51 PM3/26/13
to thac...@googlegroups.com
Sensacional.

Destaco isso aqui:

E isso aqui:

"Another important component of our data-bulletproofing system was keeping our code and data well-organized. Each step of the data-cleaning process had its own script. For instance, one script used Farrago to scrape a PDF and filtered out header rows. For each step, we saved each of these scripts' output. This made it easy to track down errors. If, during one of our spot checks, we found a line that was missing in our final data that was present in the source data, we could look at each step of the data-cleaning process for that document to pinpoint which script had introduced the problem. After we had fixed the problem, the whole process could be re-run with just one command."

Que acho que vale favoritar. É sempre um grande problema quando a gente esta minerando dados com scrapers e a partir de bases inconsistentes... fazer tudo ou máximo que for possível com scripts e linha de código ajuda bem.

abs,
Pedro Markun


2013/3/26 Daniel Bramatti <danielb...@gmail.com>

--
--
Você recebeu esta mensagem porque está cadastrado no grupo "Transparência Hacker"
Para enviar uma mensagem a todo o grupo, escreva para thac...@googlegroups.com
Para não receber mais mensagens, envie um email para thackday+u...@googlegroups.com
Para mais informações, ou para ler mensagens arquivadas deste grupo, visite http://groups.google.com/group/thackday?hl=pt-BR
 
---
Você está recebendo esta mensagem porque se inscreveu no grupo "Transparência Hacker" dos Grupos do Google.
Para cancelar a inscrição neste grupo e parar de receber seus e-mails, envie um e-mail para thackday+u...@googlegroups.com.
Para obter mais opções, acesse https://groups.google.com/groups/opt_out.
 
 

image002.jpg

Daniel Bramatti

unread,
Mar 26, 2013, 9:19:46 PM3/26/13
to thac...@googlegroups.com

Muito importante também o último parágrafo. Já estou coletando fundos para construir uma estátua pro tal Manuel.

One More Thing

Manuel Aristarán, a Knight-Mozilla OpenNews Fellow at La Nación, a newspaper in Buenos Aires, Argentina, has been developing a tool called Tabula for extracting tabular data from PDFs. Tabula's interface and algorithm for assembling characters into lines of text are much more developed than Farrago’s, so we’re helping fold Farrago into Tabula. Look for an open-source release of Tabula very soon.


.

.

Daniel Bramatti | Editoria Nacional - Estadão Dados - Blog Públicos | O Estado de S. Paulo

Av. Eng. Caetano Álvares, 55 - Limão - São Paulo - SP - 02598-900

+ 55 11 3856-4592

estadoQuer  Blog Públicos Estadão Dados



2013/3/26 Pedro Markun <pe...@esfera.mobi>
image002.jpg
image002.jpg

Luiz Augusto

unread,
Mar 26, 2013, 9:22:22 PM3/26/13
to thac...@googlegroups.com

Uau.

Esse post vai muito além do “simples“ problema dos PDFs para também certos sites toscamente planejados que não deixam nem buscadores varrerem, nem softwares de web archiving arquivarem cópias.

Simplesmente formidável. Merece ser favoritado e esfregado nas fuças de meio mundo.

image002.jpg
Reply all
Reply to author
Forward
0 new messages