Hola gente, mis disculpas por el off-topic, quiz�s le resulta de utilidad a alguien.
El formato que usa la edici�n electr�nica de La Naci�n es poco
simp�tico si el espacio que uno tiene en la pantalla es reducido. La
basura alrededor de las ya de por s� cortas noticias ocupa un
porcentaje muy alto del �rea visible. Adjunto hay un script que visita
la p�gina principal y saca las noticias nacionales as� como las
secciones de Opini�n y Econom�a y presenta todo como texto.
Es poco probable que funcione con otras secciones del peri�dico. Sacar
el contenido (y nada m�s el contenido) de La Naci�n fue, erm,
"educativo". Por alg�n motivo otros sitios de noticias son mucho m�s
f�ciles de trabajar que este (de ser mi decisi�n, quien "dise��" *esto*
estar�a ahora buscando nuevo empleo). En caso de que realmente no
funcione con otras secciones, "nada m�s" hay que ajustar un poco la
primera l�nea de c�digo de la funci�n "reformat". Todo se reduce a
buscar algo que identifique al contenido (por ejemplo, un td con un
color particular o algo similar -- en �ltima instancia hay que recurrir
a algo como "la segunda columna de la segunda tabla immediatamente bajo
body").
Y para que esto no sea 100% off-topic, la intenci�n original era
extraer la secci�n de computaci�n (como sea que se llame) de La Naci�n
para buscar art�culos sobre Linux :-) El problema result� ser que no
fue immediatamente evidente como calcular un URL para dicha secci�n, y
como cuando el cerebro no da lo �nico que queda es fuerza bruta, a
fuerza bruta se hizo. Ese otro script difiere de este en un "if" y una
variable.
El script ocupa LWP, URI, HTML::TreeBuilder y Text::Autoformat. Los
dos primeros es probable que ya hayan sido instalados por su
distribuci�n, los dos �ltimos los pueden obtener en CPAN. Los paquetes
de Debian son libwww-perl, liburi-perl, libhtml-tree-perl y
libtext-autoformat-perl.
Uso:
$ ./nacion.pl | less
Saludos,
Marcelo
nacion.pl.gz
Description: Binary data
