Firma Lixto (http://www.lixto.com/) ma presne takyto nastroj, ale iba ako komercny produkt.
Aj ja by som rad vedel, ci existuje nejake rozumne open source riesenie .... Stm. -----Original Message----- From: [EMAIL PROTECTED] [mailto:[EMAIL PROTECTED] On Behalf Of Petr Kolesa Sent: Friday, March 24, 2006 3:09 PM To: Java Subject: nastroj na extrakci dat z HTML stranek Ahoj, nevite nekdo, nebo jeste lepe nemate zkusenost, s nastrojem, ktery by umel vytahat udaje z html stranek? Predstavuju si to takhle: uzivatel otevre html stranku (treba ulozenou na disku) -- ta se mu zobrazi aspon ramcove podobne jako v browseru. Graficky vyznaci pozadovana data a jejich typ. Tool (pro jedoduchost treba jen na zaklade html struktury dokumentu) vygeneruje extrakcni pravidla nebo, jeste lepe, primo nejaky java-enabled extraction engine. Koukal jsem po webu a blizi se tomu jen MnM a Melita. Problem MnM je v tom, ze generovani pravidel a extrakce dat zavisi na pluginu AMILCARE, ktery jiz neni dostupny. Melita je sice taky nad AMILCAREm, ale ta uz ho aspon v sobe ma. Nevyhoda Melity je v tom, ze zhusta pada a zobrazuje html stranku jako cisty text -- v tom aby se cert vyznal. Priklad, proc to potrebuju: mam cca 40 web adres vyhledavacu clanku z oboru (napr schoolar.google.com, scopus.com, portal.isiknowledge.com, ...) a chci udelat metavyhledavac, ktery se dotaze tech vyhledavacu a pak agreguje jejich vysledky. A rozhodne se mi nechce rucne pocitat a kodovat, kolik div-tagu musim preskocit, abych precetl nazev clanku ... Taky chci, aby, az nektery z tech vyhledavacu prekope strukturu stranky, mohl pouceny laik znovu oznackovat stranku. Predpokladam, ze v dobe, kdy vsichni mluvi o semantickem webu a automatickem znackovani webu nesemantickeho, musi takovyhle naprosto fundamentalni nastroj uz existovat. Pekny den kolisko
