Fișierul llms.txt promite vizibilitate în ChatGPT. Jurnalele spun altceva

Un panou de control al site-ului web afișează date privind solicitările boturilor bazate pe IA, evidențiind un total de 62.100 de solicitări în 90 de zile și 84 de erori pentru /llms.txt. Un grafic cu bare prezintă cele mai solicitate adrese URL, precum /blog/, /servicii/ și /robots.txt.

Cuprins

De vreo doi ani circulă prin grupurile de marketing o recomandare simplă: pui un fișier numit llms.txt în rădăcina site-ului și devii vizibil pentru ChatGPT, Gemini și Perplexity. Sună plauzibil, seamănă cu ceva ce știm deja și costă un sfert de oră. Problema e că singura verificare serioasă disponibilă, o analiză de jurnale de server pe 90 de zile, a găsit 84 de cereri către acest fișier din 62.100 de cereri venite de la roboți AI. Adică o miime. Dacă vrei ca site-ul tău să fie citit corect de sistemele AI, pârghia reală rămâne alta, și anume datele structurate care descriu explicit ce conține fiecare pagină.

Ce este, concret

Este un fișier text simplu, scris în format Markdown, așezat la adresa domeniului urmată de llms.txt. Conține titlul site-ului, o descriere scurtă și o listă cu paginile pe care le consideri importante, fiecare cu o propoziție de explicație. Propunerea îi aparține lui Jeremy Howard și pornește de la o observație corectă: un model de limbaj are o fereastră de context limitată, deci ar fi util să primească o hartă curată a site-ului în loc să parcurgă tot codul HTML.

Ca idee, seamănă cu o combinație între robots.txt, care spune ce nu se citește, și harta site-ului, care spune ce există. Diferența e că robots.txt și sitemap.xml sunt standarde respectate de motoarele de căutare de peste douăzeci de ani, iar llms.txt este, deocamdată, o propunere fără standard oficial și fără implementare confirmată.

Cine îl citește, de fapt

Aici stă toată discuția, și răspunsul e neplăcut de scurt. Niciun furnizor major de modele nu a confirmat oficial că îl folosește. Documentația Google pentru dezvoltatori precizează că fișierul nu este necesar pentru suprafețele de căutare cu AI, iar reprezentanții companiei au declarat public că niciun serviciu de AI nu a spus că îl utilizează. OpenAI, Anthropic și Perplexity nu au comunicat nimic în sprijinul lui.

Jurnalele de server confirmă declarațiile. Roboții AI cer intens paginile de blog, harta site-ului și robots.txt, adică exact fișierele din protocolul stabilit. Fișierul llms.txt e cerut aproape deloc, iar cererile care apar par să vină din instrumente de dezvoltare, nu din procesul care alimentează răspunsurile date utilizatorilor.

Imaginea care însoțește acest articol reconstruiește distribuția cererilor dintr-o astfel de analiză. Cifrele sunt preluate dintr-un studiu public și au rol ilustrativ, nu sunt rezultatul unui client.

Atunci de ce îl au companii mari

Pentru că multe dintre ele îl folosesc altfel decât crede piața. Firmele de software care oferă documentație tehnică publică fișiere de acest tip ca să ușureze munca programatorilor care lucrează cu asistenți de cod: instrumentul citește harta, apoi trage paginile de documentație relevante. E o utilizare de tip context pentru agenți, nu un semnal de vizibilitate în răspunsurile publice.

Confuzia dintre cele două utilizări explică de ce recomandarea circulă atât de convingător. Fișierul chiar există pe site-uri respectate. Doar că motivul pentru care există nu e cel invocat în articolele care îl recomandă.

Ce faci în locul lui

Vizibilitatea în răspunsurile generate de AI se obține azi prin lucruri deja verificate, nu prin fișiere experimentale.

Verifică întâi dacă roboții AI au voie să intre

Multe site-uri blochează, prin robots.txt sau prin firewall, exact roboții care alimentează asistenții AI. Uneori blocarea e o decizie deliberată privind conținutul, alteori e o setare implicită pusă de furnizorul de găzduire, despre care nimeni din firmă nu știe. Deschide robots.txt și caută intrările pentru roboții marilor furnizori. Nu are rost să optimizezi pentru o vizibilitate pe care ai interzis-o la poartă.

Structurează pagina, nu doar textul

Sistemele AI extrag fragmente, nu pagini întregi. O pagină cu titluri clare, cu răspunsuri complete imediat sub întrebare și cu secțiuni care se susțin singure în afara contextului are șanse mult mai mari să fie citată decât una scrisă ca un eseu continuu. Datele structurate adaugă peste asta un strat explicit, care spune despre ce e vorba fără interpretare.

Publică ce nu poate fi dedus din altă parte

Prețuri, condiții, date proprii, cazuri concrete din piața ta. Un model care are deja variantele generale ale unui subiect nu are niciun motiv să citeze încă o repetare a lor. Are motiv să citeze o cifră pe care nu o găsește în altă parte.

Deci îl pui sau nu

Dacă ai o oră liberă și site-ul tău are documentație tehnică, pune-l. Costul e mic, riscul practic zero și, dacă standardul se impune peste doi ani, ești deja acolo. Ce nu faci e să îl treci în ofertă ca serviciu de optimizare pentru AI, să îl prezinți clientului drept măsură cu efect așteptat sau să îl pui înaintea lucrurilor care au efect confirmat.

Iar dacă îl pui, măsoară. Deschide jurnalele de acces peste trei luni și numără cererile venite către el. Vei avea atunci un răspuns pentru site-ul tău, nu pentru site-ul altcuiva, iar răspunsul acela valorează mai mult decât orice recomandare din grupurile de specialitate.

Cum te poate ajuta Emblematic

Când lucrăm partea de vizibilitate în căutarea cu AI, pornim de la ce se poate verifica în jurnale și în instrumentele de măsurare, nu de la ce se poartă. De obicei descoperim întâi lucruri neașteptate, cum ar fi roboți blocați din greșeală sau pagini importante fără niciun fel de structură.

Dacă vrei să afli dacă site-ul tău e citit sau ignorat de sistemele AI și ce se poate corecta imediat, echipa Emblematic.ro este disponibilă pentru o consultație fără obligații. Contactează-ne și stabilim împreună pașii următori.

Share: