Notícias... =)
---------- Forwarded message ----------
Enviei sem querer...
Diego, a gente aqui no NIC.br está fazendo uma discussão interna sobre
como disponibilizar esses dados. Ano passado fizemos um projeto que
envolvia justamente isso (um Censo da Internet brasileira, com uma
análise inicial do
gov.br), e que está sendo realizado novamente esse ano.
Entre os problemas que nós enfrentamos está, principalmente, o fato de muitos sites .
gov.br
utilizarem URLs com formatação estranha, ou redirects em HTML, entre
outras coisas. Se você quiser, vai haver uma palestra na quinta às 10
horas sobre o projeto de que isso foi parte. Além disso, daria pra
tentar conversar com o meu chefe, o Antonio Moreiras, que deve estar lá
no stand do NIC.br na Campus Party. Não vou sair prometendo nada, afinal
de contas nem sou isso que cuida mais precisamente disso, mas não acho
que ele seria contra, por exemplo, fornecer a versão modificada do
crawler que a gente desenvolveu.
O crawler foi feito em cima do Wire, que é um crawler open source, e tem várias funcionalidades interessantes. Não deve ser muito difícil modificá-lo para trabalhar de maneira distribuída, então pode ser uma boa idéia pro que você procura.
2011/1/18 Pedro Hadek
<pedro...@gmail.com>
Diego, a gente aqui no NIC.br está fazendo uma discussão interna sobre como disponibilizar esses dados. Ano passado fizemos um projeto que envolvia justamente isso (um Censo da Internet brasileira, com uma análise , e que provavelmente será realizado novamente esse ano.
Entre os problemas que nós enfrentamos está, principalmente, o fato de muitos sites .gov.br utilizarem URLs com formatação estranha, ou redirects em HTML, entre outras coisas. Se você quiser, vai haver uma palestra na quinta às 10 horas sobre o projeto de que isso foi parte. Além disso, daria pra tentar conversar com o meu chefe, o Antonio Moreiras, que deve estar lá no stand do NIC.br na Campus Party. Não vou sair prometendo nada, afinal de contas nem sou isso que cuida mais precisamente disso, mas não acho que ele seria contra, por exemplo, fornecer a versão modificada do crawler que a gente desenvolveu.
2011/1/18 Diego Rabatone
<dir...@diraol.eng.br>
Pessoal,
eu e mais uma galera que está participando da Campus Party queremos fazer um clone (mirror) de todos os sites .gov.br ....
A maneira mais simplista de fazer isso é usando diretamente um "wget"....
Mas gostaríamos de ir além e pensar numa estrutura que consiga rodar distribuída em diversas máquinas (salvando tudo num único servidor centralizado que levaremos pra lá amanhã). Seria algo como um "P2P" distribuido e organizado para que ninguém faça o download de algo que já foi feito ou está sendo feito.
A proposta é que a Sociedade Civil possua um mirror dos sites governamentais para que não dependamos exclusivamente deles - ou ficar sujeitos a mudanças repentinas que tirem as coisas do ar, como aconteceu com o projeto Governo Aberto SP.
E ai, alguém tem alguma sugestão do que podemos fazer?
Uma das referências que o pessoal postou é o YaCy - ainda vou ler sobre, não vi o que é.
A ideia é começar a rodar o(s) script(s) amanhã...
Abraços,
--------------------------------
Diego Rabatone Oliveira
http://blog.diraol.eng.br
diraol(arroba)diraol(ponto)eng(ponto)br
Identica: (@diraol) http://identi.ca/diraol
Twitter: @diraol