Zdraví zdrojů hlídač změn CMS / URL schématu
Deterministická kontrola (bez AI), že u každého webu pořád platí, podle čeho poznáváme článek. Když web změní systém, projeví se to tady dřív, než z toho vzniknou duplicity nebo nám články utečou. Prahy: extrakce ID < 50% nebo mrtvá sekce = alert.
zablokováno: 1 alert: 0 warn: 0 ok: 17
| zdroj | stav | článků | ID% | dup dle ID | shodný text | nových/24h | bez textu | medián slov | poznámky | |
|---|---|---|---|---|---|---|---|---|---|---|
ceskenoviny |
Zablokováno vydavatelem | 1158 | České noviny (ČTK) zablokovaly náš přístup — neunesly kritiku a nezávislý dohled nad tím, jak rámují zprávy. Šly tvrdě: firewall na naši IP (zbytek světa je vidí normálně) + v robots.txt navíc vylučují AI boty. Historická data zůstávají k analýze; nové nepřibývají, dokud se nedomluvíme na podmínkách. | |||||||
aktualne |
ok | 2477 | 100% | 26 | 68 | 0% | 436 | 26 článků se shodným textem (boilerplate/ČTK) | ||
cnnprima |
ok | 2740 | 100% | 56 | 0% | 364 | ||||
ct24 |
ok | 2261 | 100% | 19 | 49 | 420 | 19 článků se shodným textem (boilerplate/ČTK) | |||
denik |
ok | 2774 | — | 123 | 55 | 0% | 396 | 123 článků se shodným textem (boilerplate/ČTK) | ||
| ok | 1174 | 100% | 22 | 1246 | ||||||
denikto |
ok | 375 | — | 5 | 0% | 498 | ||||
e15 |
ok | 1187 | 100% | 27 | 518 | |||||
echo24 |
ok | 1911 | 100% | 43 | 403 | |||||
forum24 |
ok | 2240 | — | 45 | 0% | 399 | ||||
| ok | 1474 | 100% | 48 | 640 | ||||||
idnes |
ok | 8769 | 100% | 10 | 149 | 0% | 385 | 10 článků se shodným textem (boilerplate/ČTK) | ||
irozhlas feed |
ok | 1115 | — | 0 | 3% | 322 | ||||
lidovky |
ok | 2664 | 100% | 4 | 56 | 0% | 372 | 4 článků se shodným textem (boilerplate/ČTK) | ||
| ok | 6146 | 100% | 2 | 123 | 0% | 266 | 2 článků se shodným textem (boilerplate/ČTK) | |||
parlamentnilisty |
ok | 1999 | 100% | 195 | 2 | 0% | 443 | 195 článků se shodným textem (boilerplate/ČTK) | ||
reflex |
ok | 638 | 100% | 10 | 524 | |||||
| ok | 3945 | 98% | 94 | 84 | 0% | 502 | 94 článků se shodným textem (boilerplate/ČTK) | |||
Zdroje bez ID v URL (denik, forum24, denikto) mají ID% „—" — identitu je u nich potřeba dolovat ze stránky (canonical / og:url / JSON-LD). „shodný text" = různé články se shodným extrahovaným textem (boilerplate / agenturní přetisk). Zdroje označené feed jsou externě sycené (iROZHLAS) — data dostáváme přes ingest, takže u nich nehlídáme URL/ID schéma (to je věc původního crawleru), jen jestli feed pořád dodává čerstvé články.













