Kuidas luua LLM-veebiämbliku sõbralik veebileht

← All notes

Note

· By Marko Rillo· 2. juuni 2025· 7 min lugemistET

Kuidas luua LLM-veebiämbliku sõbralik veebileht

Kui enamik disainereid aitab luua veebilehe, mis näeb väljapoole kena, siis keelemudelite jaoks tuleb välisele ilule lisaks läbi mõelda ka lehekülje „sisemine ilu“.

skeem · LLM-veebiämblik loeb lehte
Veebiämblik siseneb lehele, loeb robots.txt ja sitemap.xml, ning pärib lubatud sisu struktuuri alusel.

Kui enamik disainereid aitab luua veebilehe, mis näeb väljapoole kena, siis keelemudelite jaoks tuleb välisele ilule lisaks läbi mõelda ka lehekülje „sisemine ilu“. Kui see on selgelt ette valmistatud, saavad otsingumootorite ja keelemudelite „ämblikud“ ning „veebikaapijad“ andmed selgema struktuuri alusel kätte.

Kõigepealt kiire ülevaade andmekogumisrobotite terminoloogiast:

  • Veebiämblik („LLM web crawler“) on nagu otsingumootori automatiseeritud andmekoguja, mis liigub lehelt lehele ja kogub avalikku sisu keelemudeli treeningandmetesse või otsinguindeksisse — enamasti automaatselt ja perioodiliselt.
  • Veebikaapija („LLM web scraper“) keskendub konkreetselt lehelt andmete korjamisele, süsteemselt ja struktureeritult — kindlatele tekstilõikudele ja pildiallkirjadele.

Veebiämblik on „viisakas külaline“: ta tutvustab ennast ametliku nimega, otsib lehelt /robots.txt ja /sitemap.xml ning pärib ainult lubatud infot lubatud sagedusega. Sellest siin räägimegi.

Veebikaapija peidab ennast tihti tavalise brauseri sildi taha ja sikutab andmeid meie tahtest sõltumatult. Enamasti eelistame kaapijaid mitte lasta — nad koormavad serverit ja kasutavad sisu valimatult. Neist ehk millalgi edaspidi.

Tehniline valmidus LLM-veebiämblike vastuvõtuks

robots.txt fail

Esimese asjana määratle juurkataloogis paikneva robots.txt faili sisu, mis selgitab, millised veebiämblikud millele juurde pääsevad. Lihtne näidis:

# Luba olulisematele AI agentidele juurdepääs - OpenAI, Perplexity ja Claude
User-agent: GPTBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: ClaudeBot
Allow: /

# Keela administraatori alad
Disallow: /admin
Disallow: /private

sitemap.xml fail

Järgmiseks vaata, kas kõige olulisem sisu kajastub sitemap.xml failis. See ütleb, milliseid lehti ja kui sageli lugeda. Näidis, mis nügib ämblikud kord kuus sisu uuendama:

<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url>
    <loc>https://ebs.ee/visioonisprint</loc>
    <lastmod>2025-08-15</lastmod>
    <changefreq>monthly</changefreq>
    <priority>0.8</priority>
  </url>
</urlset>

Semantiline valmidus

Pealkirjade jaotus

Kõige kriitilisem on pealkirjade korrektne struktuur:

  • Üks H1 kogu lehekülje kohta — ideaalis kattub olulisim sõna URL-iga. Kui URL on /visioonisprint, siis H1 „Visioonisprint. Juhile, kes soovib tuleviku osas selgust luua.“
  • H2 eristab dokumendi olulisemad sektsioonid.
  • H3 tähistab alampeatükke.
  • H4 kirjeldab lehekülje detaile.

Näide koolituslehekülje struktuurist:

<h1>Visioonisprint</h1>

<h2>Koolitusprogrammi ülevaade</h2>
<h3>Kellele mõeldud</h3>
<h3>Miks osaleda</h3>

<h2>Praktiline info</h2>
<h3>Toimumisaeg</h3>
<h3>Hind</h3>
<h3>Asukoht</h3>

<h2>Õpiväljundid</h2>
<h3>Programmi eesmärgid</h3>

<h2>Registreerumine</h2>
<h3>Registreerumise tähtaeg</h3>

Sektsioonid

LLM-id otsivad lehelt spetsiifilisi semantilisi elemente:

<nav>
  <!-- Navigatsioonilingid -->
</nav>

<main>
  <!-- Peamine sisu -->
</main>

<article>
  <!-- Koolituse kirjeldus -->
</article>

<aside>
  <!-- Registreerimisinfo, täiendav info -->
</aside>

<details>
  <!-- Praktiline info: kuupäevad, hinnad -->
</details>

Pildid ja graafikud

foto · Visioonisprindi koolitus
Osalejad (vasakult): osaleja 1, osaleja 2 ja osaleja 3 EBSi ruumides Visioonisprindi koolitusel.

Veebiämblikud on „pimedad“ ega loe piltidel olevat teksti. Kirjelda kõik pildid: alt (alla 200 tähemärgi, loevad ka ekraanilugejad), lühike title ja sisuline figcaption.

<figure>
  <img src="visioonisprint-koolitus.jpg"
       alt="Visioonisprindi koolituse 3 osalejat lahendavad disainiülesannet"
       title="Visioonisprindi koolituse foto">
  <figcaption>
    Osalejad (vasakult): osaleja 1, osaleja 2 ja osaleja 3 EBSi ruumides.
  </figcaption>
</figure>

Sisuline valmidus

Paku LLM-ile küsimusi ja vastuseid

Keelemudelid on vektoripõhised tekstilõpetajad. Küsimus-vastus on üks lihtsamini toimivaid keele elemente, seega KKK-laadne ülesehitus töötab hästi. Kasuta samu küsimusi, mida kasutaja LLM-i sisestaks:

  • Kuidas koolitusega liituda? → Registreerumiseks täida vorm EBS kodulehel või võta ühendust telefonil …
  • Kui pikalt koolitus kestab? → Visioonisprindi koolitus kestab 3 järjestikust täispäeva.
  • Kes koolitust läbi viivad? → Koolitajad on: koolitaja 1, koolitaja 2, koolitaja 3.

Struktureeritud loendid

Keelemudel tunneb teksti sageli ära struktureeritud loendite ja tabelite põhjal:

<h3>Programmi läbinu oskab:</h3>
<ul>
  <li>Tuvastada ja analüüsida ärikeskkonna väljakutseid</li>
  <li>Rakendada disainimõtlemise meetodeid</li>
  <li>Prototüüpida ja testida lahendusi</li>
  <li>Koguda ja analüüsida tagasisidet</li>
</ul>

Kokkuvõtteks

LLM-ämblike sõbralik veebilehekülg vajab:

  • Tehnilist alust — robots.txt ja sitemap.xml
  • Struktureeritud pealkirju — H1–H4 hierarhia
  • Semantilist HTML-i — main, article, section, aside
  • Kirjeldatud pilte — alt, title, figcaption
  • Struktureeritud sisu — küsimused-vastused, loendid, tabelid

Need muudatused ei paranda mitte ainult LLM-ide ligipääsu, vaid ka kasutajakogemust ja otsingumootorite positsioone.