(muito) atrasado, mas aqui vai um script em R usando wget e tidy no linux
library(XML)
fromNumBr <- function(x) {
as.numeric(gsub(",", ".", gsub("\\.|[^,0-9-]", "", x)))
}
system('wget
http://www2.camara.sp.gov.br/Salarios/HTML/todos.html')
system('tidy todos.html > todos_tidy.html')
doc <- htmlTreeParse(readLines('todos_tidy.html'), asText=TRUE,
useInternalNodes=TRUE)
nset <- getNodeSet(doc, "//td")
nset <- sapply(nset, xmlValue)
##salario em multiplas linhas. vamos pegar so o ultimo
sl <- grep('após desc. P', nset)
nset <- nset[-c(sl, sl-1, sl+1)]
## constroi matriz
dnow <- data.frame(matrix(nset[-c(sl, sl-1, sl+1)], ncol=4, byrow=TRUE))
names(dnow) <- c('nome', 'cargo', 'funcao', 'remuneracao')
## funcao nao parseou direito. tiro por agora.
dnow$funcao <- NULL
dnow[,'remuneracao'] <- fromNumBr(dnow[,'remuneracao'])
2012/6/8 Júlio Boaro <
julio...@gmail.com>: