Firma Lixto (http://www.lixto.com/) ma presne takyto nastroj,
ale iba ako komercny produkt.

Aj ja by som rad vedel, ci existuje nejake rozumne open source riesenie
....

Stm.

-----Original Message-----
From: [EMAIL PROTECTED] [mailto:[EMAIL PROTECTED] On
Behalf Of Petr Kolesa
Sent: Friday, March 24, 2006 3:09 PM
To: Java
Subject: nastroj na extrakci dat z HTML stranek

Ahoj,

nevite nekdo, nebo jeste lepe nemate zkusenost, s nastrojem, ktery by 
umel vytahat udaje z html stranek? Predstavuju si to takhle: uzivatel 
otevre html stranku (treba ulozenou na disku) -- ta se mu zobrazi aspon 
ramcove podobne jako v browseru. Graficky vyznaci pozadovana data a 
jejich typ. Tool (pro jedoduchost treba jen na zaklade html struktury 
dokumentu) vygeneruje extrakcni pravidla nebo, jeste lepe, primo nejaky 
java-enabled extraction engine.

Koukal jsem po webu a blizi se tomu jen MnM a Melita. Problem MnM je v 
tom, ze generovani pravidel a extrakce dat zavisi na pluginu AMILCARE, 
ktery jiz neni dostupny. Melita je sice taky nad AMILCAREm, ale ta uz ho

aspon v sobe ma. Nevyhoda Melity je v tom, ze zhusta pada a zobrazuje 
html stranku jako cisty text -- v tom aby se cert vyznal.

Priklad, proc to potrebuju: mam cca 40 web adres vyhledavacu clanku z 
oboru (napr schoolar.google.com, scopus.com, portal.isiknowledge.com, 
...) a chci udelat metavyhledavac, ktery se dotaze tech vyhledavacu a 
pak agreguje jejich vysledky. A rozhodne se mi nechce rucne pocitat a 
kodovat, kolik div-tagu musim preskocit, abych precetl nazev clanku ... 
Taky chci, aby, az nektery z tech vyhledavacu prekope strukturu stranky,

mohl pouceny laik znovu oznackovat stranku.

Predpokladam, ze v dobe, kdy vsichni mluvi o semantickem webu a 
automatickem znackovani webu nesemantickeho, musi takovyhle naprosto 
fundamentalni nastroj uz existovat.

Pekny den

        kolisko

Odpovedet emailem