Material da operação que prendeu Cachoeira

3 views
Skip to first unread message

Fabiano Angélico

unread,
May 9, 2012, 3:07:52 PM5/9/12
to Transparência Hacker
Vazaram os 40 Gb de texto, áudio e vídeo da Operação Monte Carlo, a do
Carlos Cachoeira ~> http://www.brasil247.com ou http://migre.me/917Zb
(Facebook)

Se esse material não for "destravado" de seus PDFs e afins, muita
coisa vai ficar escondida, apesar de disponibilizada.

Não daria para montar um sisteminha que transformasse todos esses PDF
numa coisa mais amigável? E o que daria pra fazer com os áudios e
vídeos?

Diego Rabatone

unread,
May 9, 2012, 3:24:48 PM5/9/12
to thac...@googlegroups.com
Fabiano, depende muito de como são esses PDF's.

Se forem, por exemplo, imagens escaneadas de documentos em papel, seria necessário passar cada uma das imagens por algum software de OCR (software que transforma imagens em textos, por meio de reconhecimento ótico de caracteres) e depois revisar (porque dependendo da qualidade da imagem e do texto o percentual de acerto do OCR varia bastante. Se for texto escrito à mão fica muito pior).

Se forem PDF's "nativos", com texto que pode ser "selecionado, copiado e colado", dá pra tentar exportar o PDF para texto, mas ainda assim precisaria de bastante revisão do resultado final, porque o PDF não é exatamente amigável .....

Tem que ver com calma como são os pdf's mesmo.... mais tarde eu tento dar uma olhada neles. =)

Independente disso, tem que transformar esses 40Gb em torrent e dispersar pela web! =)

Abraços,

--------------------------------
Diego Rabatone Oliveira
diraol(arroba)diraol(ponto)eng(ponto)br
Identica: (@diraol) http://identi.ca/diraol
Twitter: @diraol




--
Você recebeu esta mensagem porque está cadastrado no grupo "Transparência Hacker"
Para enviar uma mensagem a todo o grupo, escreva para thac...@googlegroups.com
Para não receber mais mensagens, envie um email para thackday+u...@googlegroups.com
Para mais informações, ou para ler mensagens arquivadas deste grupo, visite http://groups.google.com/group/thackday?hl=pt-BR

Pedro Markun

unread,
May 9, 2012, 3:28:29 PM5/9/12
to thac...@googlegroups.com
Opa,

eu estou trabalhando com a OKFNBr em um sistema pra 'transcrever pdfs' colaborativamente... depois da um feedback do que descobriu ai Rabatone :)

abs,
Pedro Markun

2012/5/9 Diego Rabatone <dir...@diraol.eng.br>

Fabiano Angélico

unread,
May 9, 2012, 5:05:14 PM5/9/12
to Transparência Hacker
Já estão em torrent, Rabatone. E estão no thepiratebay.se. Ex:
http://thepiratebay.se/torrent/7255967

On 9 maio, 16:24, Diego Rabatone <dir...@diraol.eng.br> wrote:
> Fabiano, depende muito de como são esses PDF's.
>
> Se forem, por exemplo, imagens escaneadas de documentos em papel, seria
> necessário passar cada uma das imagens por algum software de OCR (software
> que transforma imagens em textos, por meio de reconhecimento ótico de
> caracteres) e depois revisar (porque dependendo da qualidade da imagem e do
> texto o percentual de acerto do OCR varia bastante. Se for texto escrito à
> mão fica muito pior).
>
> Se forem PDF's "nativos", com texto que pode ser "selecionado, copiado e
> colado", dá pra tentar exportar o PDF para texto, mas ainda assim
> precisaria de bastante revisão do resultado final, porque o PDF não é
> exatamente amigável .....
>
> Tem que ver com calma como são os pdf's mesmo.... mais tarde eu tento dar
> uma olhada neles. =)
>
> Independente disso, tem que transformar esses 40Gb em torrent e dispersar
> pela web! =)
>
> Abraços,
>
> --------------------------------
> Diego Rabatone Oliveira
> diraol(arroba)diraol(ponto)eng(ponto)br
> Identica: (@diraol)http://identi.ca/diraol
> Twitter: @diraol
>
> Em 9 de maio de 2012 16:07, Fabiano Angélico
> <fabianoangel...@gmail.com>escreveu:
>
>
>
>
>
>
>
> > Vazaram os 40 Gb de texto, áudio e vídeo da Operação Monte Carlo, a do
> > Carlos Cachoeira ~>http://www.brasil247.comouhttp://migre.me/917Zb

Lucas Alberto

unread,
May 10, 2012, 5:10:33 PM5/10/12
to Transparência Hacker
Opa,

Faz alguns dias (logo que vazou) que peguei um dos pdfs e passei num
ocr linha de comando, a saída eu fiz upload no Many Eyes.
http://www-958.ibm.com/software/data/cognos/manyeyes/datasets/monte-carlo-opr/versions/1
O problema é que são fotocópias então o ocr vacila total em montar
palavras, a maior parte do texto é legível mas as palavras não estão
bem formadas. Talvez um ocr bem tunado dê melhores resultados.

lucasa



On 9 maio, 16:24, Diego Rabatone <dir...@diraol.eng.br> wrote:
> Fabiano, depende muito de como são esses PDF's.
>
> Se forem, por exemplo, imagens escaneadas de documentos em papel, seria
> necessário passar cada uma das imagens por algum software de OCR (software
> que transforma imagens em textos, por meio de reconhecimento ótico de
> caracteres) e depois revisar (porque dependendo da qualidade da imagem e do
> texto o percentual de acerto do OCR varia bastante. Se for texto escrito à
> mão fica muito pior).
>
> Se forem PDF's "nativos", com texto que pode ser "selecionado, copiado e
> colado", dá pra tentar exportar o PDF para texto, mas ainda assim
> precisaria de bastante revisão do resultado final, porque o PDF não é
> exatamente amigável .....
>
> Tem que ver com calma como são os pdf's mesmo.... mais tarde eu tento dar
> uma olhada neles. =)
>
> Independente disso, tem que transformar esses 40Gb em torrent e dispersar
> pela web! =)
>
> Abraços,
>
> --------------------------------
> Diego Rabatone Oliveira
> diraol(arroba)diraol(ponto)eng(ponto)br
> Identica: (@diraol)http://identi.ca/diraol
> Twitter: @diraol
>
> Em 9 de maio de 2012 16:07, Fabiano Angélico
> <fabianoangel...@gmail.com>escreveu:
>
>
>
>
>
>
>
> > Vazaram os 40 Gb de texto, áudio e vídeo da Operação Monte Carlo, a do
> > Carlos Cachoeira ~>http://www.brasil247.comouhttp://migre.me/917Zb
Reply all
Reply to author
Forward
0 new messages