# Tooltagger — https://tooltagger.com # # Alles mag gecrawld worden. De site is publieke productinformatie en # kennisbankcontent; er staat niets achter een login. # --------------------------------------------------------------------------- # Content-Signal — waarvoor onze pagina's gebruikt mogen worden. # # Toegang en gebruik zijn twee dingen. Allow zegt of een bot de pagina mag # ophalen; het signaal hieronder zegt wat hij er daarna mee mag. Drie # categorieën, elk ja of nee (contentsignals.org): # # search — indexeren en als zoekresultaat tonen: een link met een # fragment eromheen. Niet: een samenvatting die het bezoek # vervangt. # ai-input — de pagina er live bij pakken om een vraag te beantwoorden, # met bronvermelding. Dit is waar wij genoemd worden als # iemand een taalmodel vraagt hoe je NEN 3140 bijhoudt. # ai-train — de tekst gebruiken om een model te trainen. # # Alle drie staan op ja, en dat is dezelfde keuze als hieronder: wij willen # gevonden en geciteerd worden. Wie ai-train wil dichtzetten, verandert dit # woord en zet GPTBot, CCBot, Google-Extended en Applebot-Extended verderop # op Disallow — anders spreken de twee helften van dit bestand elkaar tegen. # # Het signaal staat alleen in de *-groep. Het gaat over gebruik, niet over # toegang, en geldt daarmee voor iedereen; de groepen per bot verderop gaan # alleen over de vraag of ze binnen mogen. # --------------------------------------------------------------------------- User-agent: * Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / # --------------------------------------------------------------------------- # AI-crawlers en answer engines. # # Deze staan er expliciet in. Niet omdat "User-agent: *" ze niet al toelaat, # maar omdat sommige bots alleen op hun eigen naam kijken en een aparte regel # als bevestiging lezen. Ze zijn opgesplitst in twee soorten: # # trainen — de bot verzamelt materiaal voor een model # ophalen — de bot haalt een pagina op omdat een gebruiker er nu iets # over vraagt, en citeert de bron in het antwoord # # De ophaal-bots zijn waar de zichtbaarheid vandaan komt: die bepalen of # Tooltagger genoemd wordt als iemand ChatGPT of Perplexity vraagt hoe je # NEN 3140-keuringen bijhoudt. Die horen aan te staan. # --------------------------------------------------------------------------- # OpenAI — ophalen namens de gebruiker, en het zoekindex User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / # OpenAI — trainen User-agent: GPTBot Allow: / # Anthropic User-agent: ClaudeBot Allow: / User-agent: Claude-User Allow: / User-agent: Claude-SearchBot Allow: / # Google — de AI-antwoorden en Gemini User-agent: Google-Extended Allow: / # Perplexity User-agent: PerplexityBot Allow: / User-agent: Perplexity-User Allow: / # Microsoft Copilot en Bing User-agent: bingbot Allow: / # Apple Intelligence User-agent: Applebot Allow: / User-agent: Applebot-Extended Allow: / # Meta AI User-agent: meta-externalagent Allow: / # Common Crawl — voedt veel openbare datasets User-agent: CCBot Allow: / # Mistral User-agent: MistralAI-User Allow: / # Amazon User-agent: Amazonbot Allow: / # You.com User-agent: YouBot Allow: / # Diffbot User-agent: Diffbot Allow: / Sitemap: https://tooltagger.com/sitemap-index.xml # Een kaart van de site in markdown, opgezet volgens llmstxt.org. Staat hier # omdat niets anders ernaar verwijst en een bot er anders naar moet raden. # llms.txt bevat de structuur met een zin per pagina; llms-full.txt bevat de # volledige tekst van alle artikelen. # https://tooltagger.com/llms.txt # https://tooltagger.com/llms-full.txt