--
Você está recebendo esta mensagem porque se inscreveu no grupo "Transparência Hacker" dos Grupos do Google.
Para postar neste grupo, envie um e-mail para thac...@googlegroups.com.
Para cancelar a inscrição nesse grupo, envie um e-mail para thackday+u...@googlegroups.com.
Para obter mais opções, visite esse grupo em http://groups.google.com/group/thackday?hl=pt-BR.
Bom trabalho para voces.
Em 02/04/11, Luis Leao<luis...@gmail.com> escreveu:
> http://scraperwiki.com/scrapers/mapaservidorespublicossp/
>
> Precisa puxar os endereços dos PDF's
>
> []'s
>
>
>
> 2011/4/2 Pedro Markun <pe...@esfera.mobi>
>
>> Leandro,
>>
>> vou brincar aqui, faz tempo que quero aprender a scrapear pdfs tb. E
>> o scraperwiki tem tentando melhorar o scraping ede pdfs.
>>
>>
>> http://blog.scraperwiki.com/2010/12/17/scraping-pdfs-now-26-less-unpleasant-with-scraperwiki/
>>
>> Mas ó, vou cobrar as visualizações, hein!
>>
>>
>> <http://blog.scraperwiki.com/2010/12/17/scraping-pdfs-now-26-less-unpleasant-with-scraperwiki/>
>> []'s
>> Pedro Markun
>>
>>
>> 2011/4/2 Leandro Salvador <leandro...@gmail.com>
>>
>>> Olá THackers!
>>>
>>> Por acaso há algum "data scrapper expert" aqui disposto a criar um script
>>> capaz de raspar um PDF típico como "input", que gere um CSV como
>>> "output"?
>>>
>>> Trata-se do seguinte: o Governo do Estado de São Paulo disponibiliza, no
>>> site "Prestando Contas", todos os cargos e funções ocupados por todos
>>> (até
>>> onde sei) os servidores públicos paulistas. Nitidamente, trata-se de um
>>> conjunto de planilhas com o mesmo layout, mas que foram disponibilizadas
>>> à
>>> humanidade, adivinhem!!!, em PDF, claro! :)
>>>
>>> Daí que, apesar de estar disponível apenas no não-legível-por-máquina
>>> formato PDF, uma vez criado o CSV, há dimensões razoavelmente bem
>>> estruturadas de dados disponíveis para cruzamentos ali. Dá pra ver, por
>>> exemplo, a proporção de cargos comissionados em relação ao total de
>>> cargos
>>> em diferentes níveis de resolução (secretarias, coordenadorias,
>>> departamentos)... é show de bola!
>>>
>>> O que não sei é como automatizar este processo, alguém aqui sabe e
>>> habilita-se? :)
>>>
>>> Segue o mapa-da-mina:
>>>
>>> 1. Página da Secretaria de Fazenda <http://www.fazenda.sp.gov.br/>
>>> <http://www.fazenda.sp.gov.br/>2. Prestando
>>> Contas<http://www.fazenda.sp.gov.br/contas1/default.shtm>
>>> <http://www.fazenda.sp.gov.br/contas1/default.shtm>3. Servidores do Poder
>>> Executivo
>>> 4. Relação de Servidores por
>>> Secretaria<https://www.fazenda.sp.gov.br/SigeoLei131/Paginas/DDPEEscolhaConsulta.aspx>
>>> 5. Secretaria de Gestão
>>> Pública<https://www.fazenda.sp.gov.br/SigeoLei131/Paginas/Arquivos/PAGD471.ORG044.DT012011.pdf>
--
Enviado do meu celular
Thiago Ávila
+ 55 82 88061783
http://www.thiagoavila.net
precisamos testar um pouco mais...e ainda faltam três departamentos. mas já da pra brincar.
Abraços!--
Abraços!--
galere, tem como eu instalar essa lib de pdftoxml no meu pc? eu vi aqui que é uma ferramenta do scraperwiki (vem com o import scraperwiki) mas eu não sei como instalar o modulo do scraperwiki -- e nem quero, porque ele provavelmente lida com dbs semelhantes ao do scraperwiki, e eu só quero a parte do pdftoxmlclaro que, via das dúvidas, eu posso instalar uma copia local do scraperwiki na minha maquina. mas eu acho que isso é trabalho demais pra uma coisa tão simples, então eu prefiro consultar os sábios da comunidade ;)
--