Dados Abertos 2.0 da Câmara dos Deputados

53 views
Skip to first unread message

Pedro Brandao

unread,
Sep 26, 2014, 11:20:36 AM9/26/14
to thac...@googlegroups.com
Olá pessoal,

Trabalho no Laboratório Hacker da Câmara e, como alguns já tomaram conhecimento (foi dito aqui na lista), há algums meses tivemos conversas iniciais sobre um projeto para a criação de piloto para um novo modelo de Dados Abertos. O escopo do projeto mudou bastante desde então, mas a boa notícia é que vai sair do papel.

O piloto irá envolver os dados primários sobre proposições, que atualmente alimentam um Data Warehouse, de onde os extrairemos. Em um primeiro momento, os dados serão divulgados de forma estática e, posteriormente, com uma interface dinâmica. Além disso, teremos a oportunidade de utilizar novas tecnologias que nos auxiliarão nessa disponibilização. A plataforma a ser usada será o CKAN.

Apesar de o escopo já estar definido, várias decisões precisarão ser tomadas ao longo do projeto, e para isso convido-os a opinarem e participarem.

Em anexo a este e-mail estão dois documentos: um cronograma do projeto (percebam que o prazo começou a correr essa semana) e o conjunto de metadados que descrevem o que será disponibilizado.

Abs,

Pedro Brandão
Laboratório Hacker

DadosAbertos2 - detalhamento das atividades.pdf
Painel-Atividade-Legislativa_metadados-técnicos.pdf

Paulo Hubert

unread,
Sep 26, 2014, 3:18:58 PM9/26/14
to thac...@googlegroups.com
Pedro,

Meu nome é Paulo Hubert, sou novo no grupo da TRansparência Hacker.
Venho trabalhando com dados abertos (principalmente da Câmara e do TSE) há cerca de um ano. Faço coleta e tratamento de dados para um núcleo de pesquisa no Departamento de Ciência Política da USP (NECI-USP - neci.fflch.usp.br). Gostaria de saber como podemos fazer para participar das discussões sobre o novo modelo de Dados Abertos. E aproveito para desde já parabenizar o laboratório hacker da Câmara pelo excelente trabalho.

abs

Eduardo Leoni

unread,
Sep 26, 2014, 3:39:11 PM9/26/14
to thac...@googlegroups.com
Minha única sugestão é permitir a extração de dados em bulk (json, CSV
bem formatado, ou xml), com mirrorring. (para minimizar custos de
transmissão.)

O resto, para mim, é detalhe. (Por exemplo, gastar tempo decidindo
quais métricas -- número de proposições por partido, parlamentar, etc
--

No mais, parabéns pelo trabalho!
> --
> Você recebeu essa mensagem porque está inscrito no grupo "Transparência
> Hacker" dos Grupos do Google.
> Para cancelar inscrição nesse grupo e parar de receber e-mails dele, envie
> um e-mail para thackday+u...@googlegroups.com.
> Para postar nesse grupo, envie um e-mail para thac...@googlegroups.com.
> Acesse esse grupo em http://groups.google.com/group/thackday.
> Para ver essa discussão na Web, acesse
> https://groups.google.com/d/msgid/thackday/d7d80c74-758f-4bf6-a626-111ad8d86ca7%40googlegroups.com.
>
> Para mais opções, acesse https://groups.google.com/d/optout.

Pedro Markun

unread,
Sep 26, 2014, 9:01:44 PM9/26/14
to thackday
ps: Toda vez que leio 'data warehouse' em email de um servidor público, uma fada morre e eu acho que estou vendo uma miragem no deserto.

Legal Pedro! Vou tentar olhar e comentar essa semana ainda. Alguém topa um mutirão?

--
Você recebeu essa mensagem porque está inscrito no grupo "Transparência Hacker" dos Grupos do Google.
Para cancelar inscrição nesse grupo e parar de receber e-mails dele, envie um e-mail para thackday+u...@googlegroups.com.
Para postar nesse grupo, envie um e-mail para thac...@googlegroups.com.
Acesse esse grupo em http://groups.google.com/group/thackday.

Diego Rabatone

unread,
Sep 27, 2014, 11:28:18 AM9/27/14
to Transparência Hacker

Fantástico Pedro!!
Os prazos estão bem complicado para que eu possa participar, mas se eu puder irei colaborar sim!!

Uma coisa que eu recomendo ser pensada (baseado na nossa experiência com o radar parlamentar) é tracking de atualização. Com o radar queremos manter nossas bases atualizadas,  mas sempre temos que baixar os dados de um determinado período e comparar para ver se já temos base ou não,  o que acho ruim para os dois lados.

Outro ponto,  além de um "timestamp",  é tipo um "feed"  de updates (aí já não sei se está no escopo)... Ou mesmo um serviço de "push" no qual vocês comunicam updates...

Pedro Brandao

unread,
Oct 1, 2014, 3:37:53 PM10/1/14
to thac...@googlegroups.com
Olá pessoal!

Parece que algumas pessoas estavam com problemas com os anexos. Para facilitar as coisas, atualizei o repositório com os documentos desse projeto. Acessem aí: https://github.com/labhackercd/dados-abertos-2.0

Quanto às sugestões, sugiro que as centralizemos no próprio repositório no GitHub, usando a wiki e as issues. O que vocês acham? Por enquanto poderiam alimentar a wiki com as sugestões que eu me encarrego de repassá-las. Um dos pontos que merecem a atenção de vocês é a definição da API para a disponibilização dinâmica dos dados. Para tal podemos também marcar uma reunião interativa.

À medida que forem surgindo novos materiais, irei postar aqui.

Mario Mol

unread,
Oct 1, 2014, 3:43:45 PM10/1/14
to thackday
criei um ticket la.. reforço o discurso de termos o dump da base.. isso é o que mais falta.. e é basicao!!

abs

Pedro Brandao

unread,
Oct 1, 2014, 4:16:55 PM10/1/14
to thac...@googlegroups.com
Mario e Eduardo, estão previstas duas formas de divulgação desses dados: estática e dinâmica. A forma estática é essencialmente um dump dos dados. Não sei informar qual será o formato (ainda não foi definido, então se houver argumentos pró algum formato, podem registrar lá no github!), mas certamente será um desses que citou: JSON, XML, ou CSV. A questão de mirroring não foi abordada. Por se tratar de um piloto relativamente pequeno, creio que não haverá a necessidade em um primeiro momento. À medida que a oferta de dados aumentar (e a demanda, por consequência), certamente se tornará uma necessidade.

Lembrando que esse piloto aborda um conjunto de dados novo, ainda não disponibilizado. Por enquanto não está previsto migrar os dados abertos atuais para a nova plataforma, mas dependendo do sucesso dessa implantação, é provável que isso se torne realidade.

Abs,

Pedro Brandão
Laboratório Hacker

Mario Mol

unread,
Oct 1, 2014, 4:19:36 PM10/1/14
to thackday
o dump nao vai ser construido com os dados q ja estao em web service hj??

=(

Pedro Brandao

unread,
Oct 2, 2014, 3:21:50 PM10/2/14
to thac...@googlegroups.com
Mario, infelizmente no piloto não. Dê uma olhada na declaração de escopo que está no github. O objetivo é testar e desenvolver novas formas de disponibilizar os dados abertos, abrangendo diversos aspectos: tecnologias, ferramentas, documentação e governança. A depender do êxito do projeto, é inevitável que em algum momento os dados já existentes sejam migrados para essa plataforma. Então não desanime! Queremos que esse piloto seja apenas o começo.

Abs,

Pedro Brandão
Laboratório Hacker

Pedro Brandao

unread,
Oct 23, 2014, 1:58:19 PM10/23/14
to thac...@googlegroups.com
Pessoal,

Temos novidades do projeto! Avançamos na extração dos dados estáticos que serão disponibilizados para o piloto. São dados de proposições, desde que tenham iniciado a tramitação a partir da 51ª legislatura (ou seja, 1999). Para o DW (e, portanto, para os dados abertos fornecidos com base nele) foram considerados apenas seis tipos de proposição:

PEC (Proposta de Emenda à Constituição)
PLP (Projeto de Lei Complementar)
PL (Projeto de Lei)
MPV (Medida Provisória)
PDC (Projeto de Decreto Legislativo)
PRC (Projeto de Resolução da Câmara dos Deputados)

Apesar de dados de proposições já estarem disponíveis no portal de dados abertos da Câmara, perceberão algumas diferenças. Por exemplo, alguns campos indicam se a proposição se tornou em norma (e o nome da norma, se houver) e se houve veto.

Os dados em si ainda não estão disponíveis (mas o cronograma segue para disponibilizarmos em breve, assim que a plataforma estiver pronta). Acrescentamos ao GitHub dois arquivos com os metadados: schema.json e Painel-Atividade-Legislativa_metadados.csv (disponíveis no seguinte link: https://github.com/labhackercd/dados-abertos-2.0). Esses dois arquivos irão auxiliá-los a compreender melhor o conjunto de dados. Alguns campos não serão incluídos na versão final por se tratarem de IDs artificiais, mas já permite uma compreensão boa.

Gostaríamos de saber a opinião de vocês quanto ao formato que temos no momento. Estamos abertos a sugestões quanto à disponibilização dinâmica desses dados (API). Quais web services podem ser úteis para as aplicações construídas com base nesses dados?

Abs,

Pedro Brandão
Laboratório Hacker
Reply all
Reply to author
Forward
0 new messages