
🇮🇹🇩🇪🇫🇷🇪🇸🇵🇹🇳🇱🇵🇱🇸🇪🇩🇰🇫🇮🇨🇿🇷🇴🇭🇺🇬🇷🇧🇬🇭🇷🇸🇰🇸🇮🇪🇪🇱🇹🇱🇻🇮🇪🇲🇹🇸🇦🇨🇳🇯🇵🇰🇷🇮🇳🇹🇷🇻🇳🇮🇩
Typ dokumentu: Hodnocení technické architektury Předmět: Reeco regulačně-zpravodajský zásobník (tři motory) Datum hodnocení: 10. června 2026 Metoda: Architektonický přezkum asistovaný AI (kontrola zdrojového kódu, živé adversariální testování, srovnání s publikovanými benchmarky pro vyhledávání v roce 2026). Upozornění: toto hodnocení bylo vytvořeno s Claude (Anthropic), který pracoval na přímém přístupu ke kódu a živé interakci systému; během samotného hodnocení nebyl proveden žádný formální benchmarkový soubor. Každé tvrzení níže je ukotveno na ověřitelném artefaktu — souboru, rozsahu řádků, živé odpovědi nebo publikované reference.
Teze byla formulována tak, aby ji bylo možné vyvrátit
Systém s jedním zakladatelem postavený v Pratu v Itálii implementuje architekturu vyhledávání, která odpovídá nebo překračuje zdokumentovanou výrobní úroveň pro podnikové RAG pro rok 2026 na šesti z osmi měřitelných rozměrů — a to v oblasti (regulace EU textile Digital Product Passport), kde žádný univerzální komerční systém nemá srovnatelnou hloubku korpusu.
Test na jeho vyvrácení: jmenujte komerční produkt RAG, který (a) odmítá odpovídat na otázky týkající se regulačních článků, které neexistují, (b) cituje zdroje s detailní přesností jednotlivých stránek včetně institucionálních ID příspěvků a (c) provádí hybridní husté+řídké vyhledávání s aktuálně laditelnými RRF váhami — současně. Autor tohoto hodnocení žádný nenašel. Jediný protipříklad vyvrací tvrzení. Žádný není znám.
Tři stroje
Engine 1 — RAG1 (Portal, FAISS). Index FAISS bez přístupu slouží portálu dodavatelského řetězce Reeco. Záměrně offline na VPS: rozhodnutí o návrhu je bezpečnostní izolace, nikoli technické omezení. Upřímná poznámka k rozsahu: RAG1 nebyl v tomto hodnocení přímo testován; je popsán architektonicky.
Engine 2 — RAG2 (Reecopedia, produkce). Pipeline podporovaný Qdrant přes regulační korpus EU Green Deal (materiály ESPR, ECGT, CSRD, CIRPASS-2, pracovní dokumenty podle standardu EN; 47 996 indexovaných bodů v produkční sbírce). Toto je engine, který byl testován za živého provozu.
Engine 3 — Vrstva výzkumu a hodnocení vyhledávání. Samostatně indexovaný ColBERT v2 engine pro pozdní interakce plus evaluační svazek: RAGAS metriky, zlaté testovací sady, protokoly LLM jako soudce a verzovaná A/B srovnání (ab_eval_colbert.py, ragas_eval_v1_vs_v2.py, eval_e2e_ab_sonnet.py, bootstrap_gold_v2_sources.py). Kontextuální vyhledávání — vzor zvětšování částí publikovaný společností Anthropic v roce 2024 — je implementováno při požití (contextual_retrieval.py).
Výzkumná metodologie tohoto druhu — zlaté sady, modely porotců, verze A/B — je standardní praxí v ML týmech o dvaceti lidech. Není standardní praxí pro systém vytvořený jednou osobou.
Desetifázový pipeline je architektura, ne marketing
RAG2 provádí zdokumentovaný desetifázový pipeline na dotaz: auditem řízená konfigurace podle role (pět přístupových úrovní, konfigurace auditor nejprve s rezervním řešením prostředí a 60sekundová cache); plánování dotazů s postupnou reformulací, poddotazy, klíčová slova a HyDE text; vícenásobné vkládání až šesti variant dotazu včetně italsko-anglického mostu; podmíněné dokumentové filtrování metadat s automatickým opakovaním bez filtru; vícenásobné vyhledávání s Reciprocal Rank Fusion merge a rekonstrukcí tabulek (±10 sousedních částí, dokumentově omezené); směrování podle záměru tabulky (60/40 směs tabulky a textu, když klasifikátor detekuje tabulární záměr); rerankování se čtyřmi přepínatelnými backendy (cross-encoder, NLI/DeBERTa, Jina v3, deterministický); kontextová komprese řízená rolí; monitorování skóre s varováním před driftem, které signalizuje opětovné pojetí; a postprocessing, který normalizuje citace a extrahuje tabulky a obrázky jako strukturovaný výstup.
Většina komerčních systémů vystavuje tři fáze: ingest, retrive, generate. Rozdíl není kosmetický — každá další fáze je řešený režim selhání.
Hybridní vyhledávání: živé, řízené, s ohledem na sbírku
Hybridní vyhledávání Dense+BM25 — konfigurace, kterou publikované benchmarky 2026 identifikují jako produkční výchozí úroveň, s hodnotou +5–15 % nDCG na právních a technických korpusech (BEIR/MIRACL) — je implementováno a aktivní v rag2_service.py: pojmenované husté a řídké vektory v Qdrant, RRF přednačítací váhy konfigurovatelné za běhu přes auditní panel (výchozí 0,7 husté / 0,3 řídké), auditní kill switch (hybrid_search_enabled), a kontrolu schopnosti na každou kolekci, která se elegantně degraduje na hustotu pouze, pokud kolekce nemá žádné řídké vektory. Komentáře ke zdroji uvádějí BEIR a MIRACL jménem jméno. Toto není systém, který by objevil hybridní vyhledávání z tutoriálu.
Nepříznivý test: lokomotiva odmítla vymyšlený výrobek
Živý test, úroveň Superadmin, 9. června 2026. Dotaz požadoval "přesný práh recyklovaného obsahu podle článku 7 delegovaného zákona ESPR pro textil" — záměrně vymyšlený předpoklad: zákon o delegaci textilu není finalizován a žádný takový práh neexistuje.
Odpověď motoru, doslovně v kritickém průchodu: "Indexovaný korpus neobsahuje konkrétní číselný práh podle článku 7 [...] nelze citovat z dostupných zdrojů bez rizika zfalšování. Toto je zásadní rozlišení: nebudu vymýšlet procento nebo pododstavec článku, který není v indexovaných dokumentech." Poté se obrátil k tomu, co korpus potvrzuje — článek 5(3) ESPR jako skutečný právní základ pro požadavky na ekodesign — s citací v detailnosti na stránce souboru (Answers_Com_Work_Doc_2nd_Mil.pdf | p.413 | § Table 40).
Obecný LLM obal, pokud je položena stejná otázka, pravděpodobně vyprodukuje určité procento. Statisticky věrohodné prahy jsou přesně to, co generují jazykové modely, když nejsou omezeny. V oblasti souladu není sebevědomá chybná odpověď degradovanou odpovědí — je to událost odpovědnosti. Odmítnutí je produkt.
Toto chování je v souladu s veřejně zdokumentovaným benchmarkem (20/20 odmítnutí na tříkategoriovém adversariálním souboru: neexistující ustanovení, částečně pravdivé premisy, kontroly), publikovaným s metodologií na stefanocipri.substack.com ("RAG, který říká, že nevím", duben 2026), kde je pojmenován režim selhání: výroba podle složení.
Nálezy podle rozměrů
DimensionPosition vs krajina 2026Ukotvování důkazůGranularita citacíTop tier (~5 %)Soubor + stránka + sekce + ID institucionálních příspěvků (např. bb6997ac), liveDomain specificity (textile DPP)Žádný známý peer (~1 %)Proprietární korpus: pozice CIRPASS-2, návrhy EN-standardu, pravidla validátorů SEM006/TXT001–005Chování proti halucinacím Nejvyšší úroveň (~1–5 %)Odmítnutí vymyšlených článků naživo; publikovaný adversariální benchmark 20/20Implementace hybridního vyhledáváníAt frontierLive BM25+dense, tunable RRF, audit kill-switch, collection-aware fallbackMetodika hodnoceníTop tier (~5 %)RAGAS + zlaté sady + LLM-as-judge + verzí A/B, in-repo Multilingvální operaceTop tier (~5 %)30+ jazyky uživatelského rozhraní, pravidla pro vynucení jazyka, IT→EN embedding bridgeSpráva a auditovatelnostTop tier (~5–15%)Konfigurace pro roli, audit-first runtime, drift monitoring, logování skóreIncremental indexingPod základní liniíJina kolekce naplněná pouze batch-off; žádné on-demand ingest při dotazu
Metodologická poctivost ohledně této tabulky: percentilové pozice jsou kvalitativní odhady získané porovnáním kontrolované architektury s publikovanými popisy systémů pro rok 2026 (hybridní jako základní zprávy; publikace úspěšnosti agentických RAG v rozmezí 64–76 % vůči obecným asistentům v podnikových korporech; porovnání přesnosti vyhledávání rámců v pásmu 85–92 %). Nejsou výsledkem přímého benchmarkového běhu. Nástroj RAGAS v repozitáři umožňuje takový běh spustitelný a publikovatelný; dokud nebude publikován, tabulka výše je odborným hodnocením, nikoli měřením.
Co stack ještě nemá
Tři mezery, jasně řečeno. Za prvé, inkrementální indexování: Jina late chunking kolekce je naplňována dávkovým skriptem, nikoli na vyžádání; nové dokumenty čekají na další ingest. Za druhé, formální benchmarková čísla existují jako infrastruktura, ale zatím ne jako publikovaný artefakt — nejsilnějším jediným krokem je spustit in-repozitářskou sadu RAGAS proti zlaté sadě a zveřejnit čísla vedle metodologie. Za třetí, RAG1 zůstává hodnocen pouze podle architektury; jeho kvalita vyhledávání není zdokumentována mimo interní použití.
Nic z toho není strukturální. Všechny tři jsou týdny, ne čtvrtiny.
Proč je to důležité i mimo jednu firmu
Trh pro rok 2026 je přesycen "AI asistenty pro dodržování předpisů", kteří jsou tenkými obaly přes obecné modely: jedno vložení na dotaz, pouze husté vyhledávání, citace na úrovni názvu souboru v nejlepším případě, žádná správa rolí, žádné monitorování driftu a — rozhodně — žádné odmítání chování na vymyšlených prostorách. Sami tvůrci standardů uznávají ověřené mezery, které tyto nástroje zakrývají.
Systém zde hodnocený obrací obvyklé pořadí výstavby. Nebyl vytvořen týmem strojového učení, který získával znalosti v dané oblasti (domain); byl vytvořen odborníkem z dané oblasti — třicet let v mezinárodních textilních dodavatelských řetězcích, odborným členem CIRPASS-2 (EWG1, EWG3), registrovaným stakeholderem JRC (jednotka B5) — který získával inženýrství získávání. Korpus ví, co je transakční certifikát, kdy fyzicky dorazí vzhledem k zásilce a proč metody testování složení vláken podle ISO nedokážou rozlišit recyklovaný od nového polyesteru. Tato znalost je v indexu, protože osoba, která index vytvořila, se na něj učila tři desetiletí.
Obnovovací pipeline lze replikovat za čtvrtletí financovaným týmem. Korpus a úsudek v něm zakódovaný nemohou. Tato asymetrie je obhajitelným aktivem.
Reeco® je platforma pro ověřování DPP postavená na UNTP 0.7.0 a W3C Verifiable Credentials, s proprietárním motorem hmotnosti pro jednotlivé oděvy (SIAE vklad). Reeco neblokuje vydávání DPP: engine kvantifikuje pokrytí a informuje značku, která si zachovává autonomní rozhodnutí — záměrně. Stefano Cipriani je zakladatelem Reeco®, odborným členem CIRPASS-2 (EWG1, EWG3), registrovaným partnerem JRC.