baixar Diário Oficial da União

1,495 views
Skip to first unread message

andre luiz silva

unread,
Apr 2, 2011, 8:23:23 PM4/2/11
to Transparência Hacker
então, há tempos que eu gostaria de copiar para uma base da de
dados(ou csv) o Diário Oficial da União

mas está disponibilizado em PDF e em outro site está em html

exemplos de como estão na web:

em pdf:
http://www.in.gov.br/imprensa/visualiza/index.jsp?jornal=1000&pagina=1&data=31/03/2011

em html:
http://www.jusbrasil.com.br/diarios/25752777/dou-secao-1-01-04-2011-pg-34

pergunta:
- é legal eu fazer isso, já que são dados públicos, não é mesmo?
- alguém poderia me ajudar, como copiar?

abs e obrigado (essa foi difícil..rs)
andré

Diego Casaes

unread,
Apr 5, 2011, 6:57:41 PM4/5/11
to thac...@googlegroups.com, andre luiz silva
André,

Não sei se é legal ou não, mas imagino que as informações do diário oficial são sim públicas, afinal estão lá e eles disponibilizam.

Acho que vale copiar essa DB e pescar os temas mais recorrentes do diário, fazer visualizações com o Many Eyes ou Wordle e coisas do tipo. 

Mas eu não posso te ajudar com essa parte de programação... =/

2011/4/2 andre luiz silva <and...@gmail.com>

--
Você está recebendo esta mensagem porque se inscreveu no grupo "Transparência Hacker" dos Grupos do Google.
Para postar neste grupo, envie um e-mail para thac...@googlegroups.com.
Para cancelar a inscrição nesse grupo, envie um e-mail para thackday+u...@googlegroups.com.
Para obter mais opções, visite esse grupo em http://groups.google.com/group/thackday?hl=pt-BR.




--
Diego Casaes
Esfera
(11) 9343-6978

andre luiz

unread,
Apr 5, 2011, 8:35:54 PM4/5/11
to Transparência Hacker
Diego,
obrigado pela dica
andré

capi etheriel

unread,
Apr 5, 2011, 10:11:22 PM4/5/11
to thac...@googlegroups.com
faz primeiro, encana com essas coisas depois. na melhor das hipoteses, eles chiam, sai no jornal, vc e seu projeto ficam famosos, e se rolar processo e essas coisas alguem te defende ou banca sua multa.

tem muitos casos mundo afora.

Pedro Markun

unread,
Apr 5, 2011, 11:11:47 PM4/5/11
to thac...@googlegroups.com, capi etheriel
é legal.

pode copiar.

abs,
pedro

2011/4/5 capi etheriel <barra...@gmail.com>
faz primeiro, encana com essas coisas depois. na melhor das hipoteses, eles chiam, sai no jornal, vc e seu projeto ficam famosos, e se rolar processo e essas coisas alguem te defende ou banca sua multa.

tem muitos casos mundo afora.

--

andre luiz

unread,
Apr 6, 2011, 12:34:05 PM4/6/11
to thac...@googlegroups.com
obrigado


Daniel Bramatti

unread,
Feb 9, 2013, 7:16:04 PM2/9/13
to thac...@googlegroups.com

Opa, que bela iniciativa. Muito bom!



.

.

Daniel Bramatti | Editoria Nacional - Estadão Dados - Blog Públicos | O Estado de S. Paulo

Av. Eng. Caetano Álvares, 55 - Limão - São Paulo - SP - 02598-900

+ 55 11 3856-4592

estadoQuer  Blog Públicos Estadão Dados



2013/2/4 <ademi...@gmail.com>
Fiz em perl, automatizei e coloquei tudo em um site facilitando pra quem quiser fazer download diariamente (não armazeno os antigos):



Em quarta-feira, 6 de abril de 2011 13h34min05s UTC-3, andre luiz silva escreveu:
obrigado


--
--
Você recebeu esta mensagem porque está cadastrado no grupo "Transparência Hacker"
Para enviar uma mensagem a todo o grupo, escreva para thac...@googlegroups.com
Para não receber mais mensagens, envie um email para thackday+u...@googlegroups.com
Para mais informações, ou para ler mensagens arquivadas deste grupo, visite http://groups.google.com/group/thackday?hl=pt-BR
 
---
Você está recebendo esta mensagem porque se inscreveu no grupo "Transparência Hacker" dos Grupos do Google.
Para cancelar a inscrição neste grupo e parar de receber seus e-mails, envie um e-mail para thackday+u...@googlegroups.com.
Para obter mais opções, acesse https://groups.google.com/groups/opt_out.
 
 

image002.jpg

Iuri Guilherme dos Santos Martins

unread,
Feb 9, 2013, 7:36:57 PM2/9/13
to thac...@googlegroups.com
O pdf em si chega a passar pelo teu servidor?

Eu tava pensando em fazer um rss que enviasse o conteúdo em html, mas aí teria que hospedar text/html em algum lugar diferente do Dropbox.

Cadê o código?

Pedro Markun

unread,
Feb 10, 2013, 6:31:33 AM2/10/13
to thac...@googlegroups.com
Bora fazer um script que sobre pro Archive.org? :)

abs,
Pedro Markun

2013/2/9 Iuri Guilherme dos Santos Martins <iuri.guil...@gmail.com>
O pdf em si chega a passar pelo teu servidor?

Eu tava pensando em fazer um rss que enviasse o conteúdo em html, mas aí teria que hospedar text/html em algum lugar diferente do Dropbox.

Cadê o código?

Diego Rabatone

unread,
Feb 10, 2013, 8:10:40 PM2/10/13
to Transparência Hacker
Ademir, share the code! =)

Pedro, ótima ideia!

--------------------------------
Diego Rabatone Oliveira
diraol(arroba)diraol(ponto)eng(ponto)br
Identica: (@diraol) http://identi.ca/diraol
Twitter: @diraol

Iuri Guilherme

unread,
Feb 11, 2013, 10:42:38 PM2/11/13
to thac...@googlegroups.com
Archive.org � bem lembrado.

Eu to tentando destruir o postscript pra transformar em xml puro e
compat�vel com html, mas ainda quero ver o c�digo que garimpa o Di�rio.

Pr�ximo passo � fazer de outros estados.

Luiz Augusto

unread,
Feb 12, 2013, 9:23:14 AM2/12/13
to thac...@googlegroups.com
Archive.org sem dúvida é uma boa adição, mas, já que vai scriptar, que tal também para o Wikimedia Commons (http://commons.wikimedia.org )?

Lá (e em todo o resto da Wikimedia) está ativa a extensão PDFHandler que possibilita, dentre outras coisas, isto:


Estando no Commons, as imagens também podem ser automaticamente utilizadas nos "artigos" da Wikipédia (boa maneira de incrementar as fontes dos verbetes!).

Ainda nos projetos Wikimedia, PDFs e DjVus do Commons podem ser utilizados no Wikisource desta forma:


Ao/se upar no Commons, a tag de licença a usar é a {{PD-BrazilGov}}, junto da tag informativa {{original}}

Pode ser de interesse, se for mexer nisso:




2013/2/12 Iuri Guilherme <iuri.guil...@gmail.com>
Archive.org é bem lembrado.

Eu to tentando destruir o postscript pra transformar em xml puro e compatível com html, mas ainda quero ver o código que garimpa o Diário.

Próximo passo é fazer de outros estados.


--
--
Você recebeu esta mensagem porque está cadastrado no grupo "Transparência Hacker" Para enviar uma mensagem a todo o grupo, escreva para thac...@googlegroups.com
Para não receber mais mensagens, envie um email para thackday+unsubscribe@googlegroups.com

Para mais informações, ou para ler mensagens arquivadas deste grupo, visite http://groups.google.com/group/thackday?hl=pt-BR

--- Você está recebendo esta mensagem porque se inscreveu no grupo "Transparência Hacker" dos Grupos do Google.
Para cancelar a inscrição neste grupo e parar de receber seus e-mails, envie um e-mail para thackday+unsubscribe@googlegroups.com.

Iuri Guilherme

unread,
Feb 12, 2013, 9:35:58 AM2/12/13
to thac...@googlegroups.com
Provavelmente vai sobrar o pdf pra mandar pra estas ferramentas de
leitura online, e posso pensar nisto,

mas meu foco maior � garantir que tudo fique em texto puro para poder
fazer um sistema de busca de termos decente, coisa que a maioria dos
sites que disponibilizam publica��es oficiais n�o permitem.

Eu n�o conhe�o ningu�m que senta pra ler um di�rio oficial, e se
conhecer, n�o vou ser simp�tico.

Ent�o a utilidade real destes di�rios oficiais para mim � disponibilizar
de uma forma que o computador possa ler, manipular, e de qualquer forma
utilizar a informa��o, porque eu n�o estou interessado em nenhuma
informa��o destes di�rios que n�o atendam os meus crit�rios de busca.

O mesmo vale para editais e licita��es.

Luiz Augusto

unread,
Feb 12, 2013, 9:56:03 AM2/12/13
to thac...@googlegroups.com
Estando no Commons+Wikisource (há o em português, às moscas, mas há), e conseguindo extrair o texto dos PDFs, você pode jogar o texto nas páginas wiki de forma similar com o link que passei no outro-email.

Estando o texto no Wikisource, ele é pesquisável tanto pela engine do próprio wiki, quanto... via Google =P

2013/2/12 Iuri Guilherme <iuri.guil...@gmail.com>
Provavelmente vai sobrar o pdf pra mandar pra estas ferramentas de leitura online, e posso pensar nisto,

mas meu foco maior é garantir que tudo fique em texto puro para poder fazer um sistema de busca de termos decente, coisa que a maioria dos sites que disponibilizam publicações oficiais não permitem.

Eu não conheço ninguém que senta pra ler um diário oficial, e se conhecer, não vou ser simpático.

Então a utilidade real destes diários oficiais para mim é disponibilizar de uma forma que o computador possa ler, manipular, e de qualquer forma utilizar a informação, porque eu não estou interessado em nenhuma informação destes diários que não atendam os meus critérios de busca.

O mesmo vale para editais e licitações.

Iuri Guilherme

unread,
Feb 12, 2013, 10:11:51 AM2/12/13
to thac...@googlegroups.com
Em 12-02-2013 12:56, Luiz Augusto escreveu:
Estando no Commons+Wikisource (há o em português, às moscas, mas há), e conseguindo extrair o texto dos PDFs, você pode jogar o texto nas páginas wiki de forma similar com o link que passei no outro-email.

Estando o texto no Wikisource, ele é pesquisável tanto pela engine do próprio wiki, quanto... via Google =P

Boa ideia, vamos se virar com o que está disponível primeiro :D

Vou reverter o processo que eu tinha começado aqui.

Só vou escrever aqui num papel uma lista de frases para me tornar incapaz de OUVIR coisas do tipo "mas a informação já está disponível para todos e qualquer um pode buscar".

Luiz Augusto

unread,
Feb 12, 2013, 10:22:19 AM2/12/13
to thac...@googlegroups.com
\o/

Ah sim, para mass uploads, interessante pedir flag de "bot", ou os sistemas de acompanhamentos de edições serão floodados e algum teenerd que gosta de transformar wiki em burocracias poderá dar block na sua conta.

Informações em geral e procedimentos específicos do Commons:


No pt.wikisource, basta ar uma conversadinha com o burocrata de lá


Fui administrador no Commons e admin+burocrata no pt.wikisource, posso ajudar em algo mais específico, só me procurar em pvt

2013/2/12 Iuri Guilherme <iuri.guil...@gmail.com>

--
--
Você recebeu esta mensagem porque está cadastrado no grupo "Transparência Hacker"
Para enviar uma mensagem a todo o grupo, escreva para thac...@googlegroups.com
Para não receber mais mensagens, envie um email para thackday+u...@googlegroups.com

Para mais informações, ou para ler mensagens arquivadas deste grupo, visite http://groups.google.com/group/thackday?hl=pt-BR
 
---
Você está recebendo esta mensagem porque se inscreveu no grupo "Transparência Hacker" dos Grupos do Google.
Para cancelar a inscrição neste grupo e parar de receber seus e-mails, envie um e-mail para thackday+u...@googlegroups.com.

Pedro Markun

unread,
Feb 12, 2013, 10:41:05 AM2/12/13
to thac...@googlegroups.com
Oi Luiz,

e pode? A rigor o DO não tem uma licença clara. Eu assumo que seja domínio público (ou, ainda, que não tenha 'direito autoral'.) mas isso é o suficiente pra ir pro commons?

abs,
Pedro Markun


2013/2/12 Luiz Augusto <lug...@gmail.com>

Pedro Markun

unread,
Feb 12, 2013, 10:43:15 AM2/12/13
to thac...@googlegroups.com
Desencana,

agora li lá o:


Bacana. Acho que rola, pq eu certamente colocaria o DO como 'deamis atos oficiais'.

abs,
Pedro Markun

2013/2/12 Pedro Markun <pe...@esfera.mobi>

Pedro Markun

unread,
Feb 12, 2013, 10:46:52 AM2/12/13
to thac...@googlegroups.com

Luiz Augusto

unread,
Feb 12, 2013, 10:57:47 AM2/12/13
to thac...@googlegroups.com

Uma das partes extressantes da Wikimedia é que a interpretação do que é livre ou deixa de ser livre não é fixa nem uniforme, depende dos voluntários que estiverem por lá. Se já leu algo sobre os debates de eliminação por relevância enciclopedica da en.wikipedia, fica mais fácil entender o que quis dizer.

Mas... quanto mais mídias associadas a uma tag de licença, maior a preguiça de mandar tudo pelo espaço, ou seja, mesmo nesse cenário não devem surgir grandes problemas xD

Pedro Markun

unread,
Feb 12, 2013, 11:16:09 AM2/12/13
to thac...@googlegroups.com
Ah, sei sim.

Foi justamente por isso que levantei a lebre.

Btw, o pandoc cospe também sintaxe de MediaWiki.

andre luiz

unread,
Feb 12, 2013, 11:50:31 AM2/12/13
to thac...@googlegroups.com
Muito obrigado
Abraços
andre

lu...@jusbrasil.com.br

unread,
Feb 14, 2013, 2:00:07 PM2/14/13
to thac...@googlegroups.com
Pessoal, o JusBrasil disponibiliza o diário oficial, em html, facilmente conversível para texto.
Gostaríamos de escutar as necessidades de vocês. Quem sabe podemos disponibiliza-lo em um formato ainda melhor.

Iuri Guilherme

unread,
Feb 14, 2013, 3:16:49 PM2/14/13
to thac...@googlegroups.com, lu...@jusbrasil.com.br
Em 14-02-2013 17:00, lu...@jusbrasil.com.br escreveu:
> Pessoal, o JusBrasil disponibiliza o di�rio oficial, em html,
> facilmente convers�vel para texto.
> Gostar�amos de escutar as necessidades de voc�s. Quem sabe podemos
> disponibiliza-lo em um formato ainda melhor.

Eu quero satisfazer pelo menos dois casos de uso:

1 - Obter atrav�s de UMA requisi��o o di�rio do dia corrente na sua
totalidade;

2 - Buscar termos, ou palavras chave espec�ficas e obter em formato de
texto simples, html ou xml somente a se��o relevante para uma busca
espec�fica;

Perceba que este segundo caso de uso n�o est� bem definido e s� pode ser
melhorado, discutido, disseminado e se tornar bem definido atrav�s do
uso amplo, que � exatamente a proposta.

ademir ferreira furtado

unread,
Feb 13, 2013, 11:06:09 AM2/13/13
to thac...@googlegroups.com

Direito autoral sobre leis? Vejam o artigo: 

Sobre a  portaria do Diretor da Imprensa Nacional sobre o assunto, 
vejam o comentário publicado em:

E sobre a publicidade dos dados governamentais, vejam o artigo:

Ademir 


Enviado via iPad

ademir ferreira furtado

unread,
Feb 13, 2013, 11:48:55 AM2/13/13
to thac...@googlegroups.com
Diego

     Gostaria de compartilhar o código, mas por enquanto não vou fazê-lo para evitar que o método seja bloqueado ou alterado apenas para que não funcione, como já aconteceu. 
     Mas em breve publicarei uma orientação didática de como pode ser feito, suficiente para que qualquer um que programe em perl possa utilizar, pois é um conjunto de scripts que fui desenvolvendo e alterando aos poucos e não estão muito didáticos (preciso adaptar e colocar tudo em um único arquivo). Mas antes, pode dar uma olhada no script shell que foi colocado no site vivaolinux.com.br para download facilitado do diário oficial da união, pois o princípio é o mesmo, apenas a ferramenta é que é diferente.
     Para transformar o pdf em html, é só ter instalado o pacote xpdf, que tem o pdftotext, que pode ser usado da seguinte maneira:
    $ pdftotext -htmlmeta  -layout -enc UTF-8 'nome do arquivo.pdf'
     Sem a opção -layout deixa o texto melhor para copiar e colar, mas perde a aparência de várias colunas do original.

Ademir

andre luiz

unread,
Feb 16, 2013, 7:12:30 AM2/16/13
to thac...@googlegroups.com
Ademir,

hoje fui baixar (http://diariooficial.kissr.com) e vi que vc incluiu o
formato html, usando a tag pre,

será que daria para deixar na forma de texto em apenas uma coluna e
não confrme o DOU em 3 colunas.

porque quando vou copiar texto,
é copiada a linha e das duas colunas, misturando os textos

abs e obrigado
andré





Em 4 de fevereiro de 2013 17:09, <ademi...@gmail.com> escreveu:
> Fiz em perl, automatizei e coloquei tudo em um site facilitando pra quem
> quiser fazer download diariamente (não armazeno os antigos):
>
> http://diariooficial.kissr.com
>
>
> Em quarta-feira, 6 de abril de 2011 13h34min05s UTC-3, andre luiz silva
> escreveu:
>>
>> obrigado
>>
>>
> --
> --
> Você recebeu esta mensagem porque está cadastrado no grupo "Transparência
> Hacker"
> Para enviar uma mensagem a todo o grupo, escreva para
> thac...@googlegroups.com
> Para não receber mais mensagens, envie um email para
> thackday+u...@googlegroups.com
> Para mais informações, ou para ler mensagens arquivadas deste grupo, visite
> http://groups.google.com/group/thackday?hl=pt-BR
>
> ---
> Você está recebendo esta mensagem porque se inscreveu no grupo
> "Transparência Hacker" dos Grupos do Google.
> Para cancelar a inscrição neste grupo e parar de receber seus e-mails, envie
> um e-mail para thackday+u...@googlegroups.com.
> Para obter mais opções, acesse https://groups.google.com/groups/opt_out.
>
>

ademi...@gmail.com

unread,
Feb 18, 2013, 10:00:09 AM2/18/13
to thac...@googlegroups.com
André Luiz

O que causa aquelas colunas é a opção -layout do pdftotext, e realmente fica ruim copiar e colar. Porém,sem esta opção, as tabelas do DO ficam irreconhecíveis. Não sei o que é pior.
Como acredito que o mais importante é permitir a procura de palavras no texto do DO, facilitando copiar e colar, vou deixar sem colunas (-raw ), com o prejuízo das tabelas, pois quem precisa ler tem o pdf.



Enviado via iPad

Iuri Guilherme

unread,
Feb 18, 2013, 10:34:17 AM2/18/13
to thac...@googlegroups.com
:D \o/

Em 18-02-2013 12:00, ademi...@gmail.com escreveu:
> Andr� Luiz
>
> O que causa aquelas colunas � a op��o -layout do pdftotext, e realmente fica ruim copiar e colar. Por�m,sem esta op��o, as tabelas do DO ficam irreconhec�veis. N�o sei o que � pior.
> Como acredito que o mais importante � permitir a procura de palavras no texto do DO, facilitando copiar e colar, vou deixar sem colunas (-raw ), com o preju�zo das tabelas, pois quem precisa ler tem o pdf.
>
>
>
> Enviado via iPad
>
> Em 16/02/2013, �s 10:12, andre luiz<and...@gmail.com> escreveu:
>
>
>> Ademir,
>>
>> hoje fui baixar (http://diariooficial.kissr.com) e vi que vc incluiu o
>> formato html, usando a tag pre,
>>
>> ser� que daria para deixar na forma de texto em apenas uma coluna e
>> n�o confrme o DOU em 3 colunas.
>>
>> porque quando vou copiar texto,
>> � copiada a linha e das duas colunas, misturando os textos
>>
>> abs e obrigado
>> andr�
>>
>>
>>
>>
>>
>> Em 4 de fevereiro de 2013 17:09,<ademi...@gmail.com> escreveu:
>>
>>> Fiz em perl, automatizei e coloquei tudo em um site facilitando pra quem
>>> quiser fazer download diariamente (n�o armazeno os antigos):
>>>
>>> http://diariooficial.kissr.com
>>>
>>>
>>> Em quarta-feira, 6 de abril de 2011 13h34min05s UTC-3, andre luiz silva
>>> escreveu:
>>>
>>>> obrigado
>>>>
>>>>
>>>>
>>> --
>>> --
>>> Voc� recebeu esta mensagem porque est� cadastrado no grupo "Transpar�ncia
>>> Hacker"
>>> Para enviar uma mensagem a todo o grupo, escreva para
>>> thac...@googlegroups.com
>>> Para n�o receber mais mensagens, envie um email para
>>> thackday+u...@googlegroups.com
>>> Para mais informa��es, ou para ler mensagens arquivadas deste grupo, visite
>>> http://groups.google.com/group/thackday?hl=pt-BR
>>>
>>> ---
>>> Voc� est� recebendo esta mensagem porque se inscreveu no grupo
>>> "Transpar�ncia Hacker" dos Grupos do Google.
>>> Para cancelar a inscri��o neste grupo e parar de receber seus e-mails, envie
>>> um e-mail para thackday+u...@googlegroups.com.
>>> Para obter mais op��es, acesse https://groups.google.com/groups/opt_out.
>>>
>>>
>>>
>> --
>> --
>> Voc� recebeu esta mensagem porque est� cadastrado no grupo "Transpar�ncia Hacker"
>> Para enviar uma mensagem a todo o grupo, escreva para thac...@googlegroups.com
>> Para n�o receber mais mensagens, envie um email para thackday+u...@googlegroups.com
>> Para mais informa��es, ou para ler mensagens arquivadas deste grupo, visite http://groups.google.com/group/thackday?hl=pt-BR
>>
>> ---
>> Voc� est� recebendo esta mensagem porque se inscreveu no grupo "Transpar�ncia Hacker" dos Grupos do Google.
>> Para cancelar a inscri��o neste grupo e parar de receber seus e-mails, envie um e-mail para thackday+u...@googlegroups.com.
>> Para obter mais op��es, acesse https://groups.google.com/groups/opt_out.
>>
>>
>>
>

andre luiz

unread,
Feb 18, 2013, 10:45:04 AM2/18/13
to thac...@googlegroups.com
Ademir,
ok
abraços e obrigado
andré

ademir ferreira furtado

unread,
Feb 20, 2013, 11:49:04 AM2/20/13
to thac...@googlegroups.com
Diego

     Eu usava o WWW::Mechanize::Firefox, juntamente com a extensão MozRepl do Firefox, que era muito lenta e precisava de muitas verificações e sincronias, mas que é, até certo ponto simples, pois deixa para o firefox o tratamento dos eventos da página e também o envio automático de cookies.
     Porém, esta semana, consegui simplificar tudo usando a recém-chegada extensão do módulo LWP::Simple, a LWP::Simple::Cookies (ainda na versão 0.01).
     A parte essencial e funcional do script está aqui (anexo), e não precisa de nada na máquina além da linguagem PERL com os módulos usados no script instalados.
     É só executar no prompt de comando:
           $ perl  in_lwp.pl 2
     ( irá baixar todas as páginas da Seção 2 do diário oficial de hoje e gerar um pdf com todas elas )

    Está feito!!!!
    



Em 10 de fevereiro de 2013 23:10, Diego Rabatone <dir...@diraol.eng.br> escreveu:
in_lwp.pl

ademir ferreira furtado

unread,
Feb 19, 2013, 3:57:26 PM2/19/13
to thac...@googlegroups.com
Diego

     Eu usava o WWW::Mechanize::Firefox, juntamente com a extensão MozRepl do Firefox, que era muito lenta e precisava de muitas verificações e sincronias, mas que é, até certo ponto simples, pois deixa para o firefox o tratamento dos eventos da página e também o envio automático de cookies.
     Porém, esta semana, consegui simplificar tudo usando a recém-chegada extensão do módulo LWP::Simple, a LWP::Simple::Cookies (ainda na versão 0.01).
     A parte essencial e funcional do script está aqui (anexo), e não precisa de nada na máquina além da linguagem PERL com os módulos usados no script instalados.
     É só executar no prompt de comando:
           $ perl  in_lwp.pl 2
     ( irá baixar todas as páginas da Seção 2 do diário oficial de hoje e gerar um pdf com todas elas )

    Está feito!!!!
    



Em 10 de fevereiro de 2013 23:10, Diego Rabatone <dir...@diraol.eng.br> escreveu:
in_lwp.pl

Iuri Guilherme

unread,
Feb 20, 2013, 1:43:44 PM2/20/13
to thac...@googlegroups.com
Em 20-02-2013 13:49, ademir ferreira furtado escreveu:
Está feito!!!!

Da pra iterar a busca com expressão regular em cada página!

Eu achei que eu ia ter que baixar todo o pdf, converter para texto, mas da pra fazer pausas a cada página e ir atualizando em "tempo real".

Agora tem que começar a ver como funciona os DOs dos demais estados brasileiros.

No de São Paulo funciona da mesma forma?

Lucas Ribeiro

unread,
Feb 20, 2013, 4:56:41 PM2/20/13
to Iuri Guilherme, thac...@googlegroups.com
Sim Iuri, a informação está longe de estar na melhor forma.
Estamos iniciando um novo projeto agora, que consiste em tratar melhor as informações, para permitir um acesso mais amplo à informação. Estamos começando ainda, e a primeira parte é escutar qual a necessidade das pessoas. Valeu pelo feedback!


Em 14 de fevereiro de 2013 17:16, Iuri Guilherme <iuri.guil...@gmail.com> escreveu:
Em 14-02-2013 17:00, lu...@jusbrasil.com.br escreveu:
Pessoal, o JusBrasil disponibiliza o diário oficial, em html, facilmente conversível para texto.
Gostaríamos de escutar as necessidades de vocês. Quem sabe podemos disponibiliza-lo em um formato ainda melhor.

Eu quero satisfazer pelo menos dois casos de uso:

1 - Obter através de UMA requisição o diário do dia corrente na sua totalidade;

2 - Buscar termos, ou palavras chave específicas e obter em formato de texto simples, html ou xml somente a seção relevante para uma busca específica;

Perceba que este segundo caso de uso não está bem definido e só pode ser melhorado, discutido, disseminado e se tornar bem definido através do uso amplo, que é exatamente a proposta.

andre luiz

unread,
Feb 20, 2013, 5:52:51 PM2/20/13
to thac...@googlegroups.com, Iuri Guilherme, Lucas Ribeiro, ademir ferreira furtado
o legal seria ter isso em uma base de dados

informação armazenada em banco de dados no formato HTML (por causa das
tabelas que aparecem no texto)

e poderíamos fazer buscas nesta base

cada registro uma informação, uma portaria, um ato...

abs
andré


Em 20 de fevereiro de 2013 18:56, Lucas Ribeiro
<lu...@jusbrasil.com.br> escreveu:

ademi...@gmail.com

unread,
Feb 20, 2013, 3:56:22 PM2/20/13
to thac...@googlegroups.com
Iuri

     Dá sim, mas percebi que tem muita hifenização de palavras entre uma página e outra. Avaliando a expressão página por página não possibilita encontrar estas palavras.
     Também percebi que as soluções somente em Perl não tratam adequadamente as palavras hifenizadas, ficando melhor fazer com pdftotext do Xpdf.
     O DO do estado de SP foi feito diferente, pois apesar de todo aquele envio de cookies de sessão, o último arquivo está em outra máquina e é só fazer o download seguindo o padrão(!!!!!).
     Dá até pra usar o utilitário curl com ranges de páginas, mas eu fiz em perl de uma forma pouco elegante mas altamente eficiente, indo da página um até dar erro.
     Este local de armazenamento é o mesmo desde que o DO era em html.
     Logo encaminharei o script em Perl.


Ademir

Enviado via iPad
--

Luiz Carlos V Silva

unread,
Feb 21, 2013, 2:23:06 PM2/21/13
to thac...@googlegroups.com
Oi André,

Não tenho um conhecimento mais detalhado do resultado final a ser alcançado, mas consultando o Jairo do Light Base ele me deu essa informação. Esse processo pode ajudar em parte?

Luiz Carlos

************************************
Luiz,

Desculpe nao deixar claro ...

O SINJ - Sistema integrado de Normais Juridicas eh desenvolvido em LightBase, veja a logomarca no canto inferior direito.

http://www.sinj.df.gov.br/

Portanto a resposta eh sim, o LightBase permite carregar e indexar o diario oficial para pesquisa textual.


==
Jairo Fonseca
LightBase Consultoria em Software Público
+55-61-3347-1949
Ja...@Cordel.com.br
www.LightBase.com.br


--
--
Você recebeu esta mensagem porque está cadastrado no grupo "Transparência Hacker"

andre luiz

unread,
Feb 21, 2013, 3:14:28 PM2/21/13
to thac...@googlegroups.com
Luiz,
obrigado
andré

Iuri Guilherme

unread,
Feb 23, 2013, 9:30:45 AM2/23/13
to andre luiz, thac...@googlegroups.com, Lucas Ribeiro, ademir ferreira furtado
Em 20-02-2013 19:52, andre luiz escreveu:
> o legal seria ter isso em uma base de dados
>
> informa��o armazenada em banco de dados no formato HTML (por causa das
> tabelas que aparecem no texto)
>
> e poder�amos fazer buscas nesta base
>
> cada registro uma informa��o, uma portaria, um ato...
>

Eu n�o acompanho esta linha de racioc�nio.

Para mim a base de dados � o site da imprensa nacional e n�o faz sentido
armazenar as mesmas informa��es em outros lugares.

Em outros casos (informa��es que s�o constantemente "apagadas" da web)
sempre sou a favor de replicar e disponibilizar em v�rios lugares ao
mesmo tempo.

No caso dos di�rios oficiais, o interesse deve ser do �rg�o que publica
isto, e se mais algu�m est� interessado, certamente n�o sou eu.

O que me interessa neste caso � tratar os dados para garantir outras
formas de acesso que n�o a tradicional (eu, por exemplo, n�o quero
baixar o pdf inteiro, usar a busca do pdf, que � ineficiente, s� pra ver
se eu j� fui exonerado de um cargo p�blico).

A maioria das buscas internas dos sites de di�rio n�o conseguem se
integrar com a de outros, tampouco conseguem ser acessadas como servi�o
web. Ent�o se eu quiser recuperar uma informa��o espec�fica em todos, ou
no maior n�mero poss�vel, de di�rios, eu tenho que convencer um ser
humano (eu, no meu caso) a abrir um navegador de humano e entrar no site
de cada institui��o que disponibiliza um di�rio.

Eu tenho impress�o de que � mais f�cil convencer meu interpretador de
perl a ir site por site buscando estas informa��es ;)

Mas de qualquer forma, eu n�o concordo em fazer uma base de dados
alternativa. Eu digo que os dados na fonte original devem se adaptar �s
necessidades de quem os utiliza.

Iuri Guilherme

unread,
Feb 24, 2013, 10:44:39 AM2/24/13
to thac...@googlegroups.com
Eu sei que as ferramentas sempre estiveram a�.

Eu sei que a informa��o sempre esteve a�.

Eu sei que a vontade de trabalhar sempre esteve a�.

Contudo, esta tua interven��o Ademir, foi fator decisivo para mim
come�ar a fazer uma coisa simples aqui, que usa ferramentas e m�todos
parecidos.

Em prazo curto mais detalhes, c�digo, etc.

ademi...@gmail.com

unread,
Feb 26, 2013, 1:21:59 PM2/26/13
to thac...@googlegroups.com
Iuri


Normalmente precisamos de alguma coisa boa que satisfaça nossas necessidades.
Sempre temos idéias ótimas que são difíceis de implementar.
Nestes casos, o ótimo é inimigo do bom e o código pronto é sempre a melhor solução, mesmo que seja apenas bom!!!
Portanto, em breve divulgarei o script do DOE de SP, mesmo que seja apenas bom.


Ademir






Enviado via iPad

Em 24/02/2013, às 12:44, Iuri Guilherme <iuri.guil...@gmail.com> escreveu:

> Eu sei que as ferramentas sempre estiveram aí.
>
> Eu sei que a informação sempre esteve aí.
>
> Eu sei que a vontade de trabalhar sempre esteve aí.
>
> Contudo, esta tua intervenção Ademir, foi fator decisivo para mim começar a fazer uma coisa simples aqui, que usa ferramentas e métodos parecidos.
>
> Em prazo curto mais detalhes, código, etc.

saloma...@gmail.com

unread,
Jan 6, 2014, 6:33:54 AM1/6/14
to thac...@googlegroups.com, ademi...@gmail.com


Bom dia Ademir como vai?

Eu utilizava seu script até meados de dezembro e o mesmo parou de funcionar, informa que não há jornal disponível.  Eu vejo que o cookie é recebido mas a partir dai não sei depurar o problema. 

Eu até substituí a url original que é redirecionada para portal.in.gov.br mas não tive muita sorte.  

"http://portal.in.gov.br/visualiza/index.jsp?jornal=$jornal&pagina=1&data=$dmy"


Poderia me ensinar a verificar se o link acima válido? Eu não sei traduzir as variáveis dentro do link, se vc puder me mandar um exemplo eu procuro seguir a diante. 

Obrigado! 

Salomão 

Em segunda-feira, 11 de março de 2013 12h20min22s UTC-3, ademi...@gmail.com escreveu:
Iuri

    Antes do script do DO do estado de SP, uma pequena alteração no script anterior, para pesquisa de palavras a partir de um arquivo, gerando um arquivo texto do resultado da pesquisa.
    Precisa do pdftotext (xpdf) instalado e do grep para funcionar.

ademi...@gmail.com

unread,
Jan 6, 2014, 3:59:51 PM1/6/14
to thac...@googlegroups.com, ademi...@gmail.com, saloma...@gmail.com
Boa tarde, Salomão!

     Feliz Ano Novo!
    
     A ideia está correta, mas a URL está bem escondida na página da imprensa nacional.
     É só alterar duas linhas:

$doc = get("http://pesquisa.in.gov.br/imprensa/jsp/visualiza/index.jsp?jornal=$jornal&pagina=1&data=$dmy");

getstore("http://pesquisa.in.gov.br/imprensa/servlet/INPDFViewer?jornal=$jornal&pagina=$i&data=$dmy&captchafield=firistAccess",
                $arq ) && print "$arq (ok)\n" ;


      O arquivo anexo já está atualizado e funcionou na minha máquina.
     
      Abraço.



Ademir
in_lwp.pl

jonat...@gmail.com

unread,
Aug 6, 2014, 10:36:00 AM8/6/14
to thac...@googlegroups.com, ademi...@gmail.com
Ademi,

Eu acompanhava sua pagina "http://diariooficial.kissr.com/", mas ela está fora do ar, como não tenho muito conhecimento de programação gostaria de saber se poderia me explicar como consigo baixar em .pdf o DOU 3.

Vlw e Abs,
Reply all
Reply to author
Forward
0 new messages