Website und Sitemap analysieren
Importieren Sie sauber nützliche öffentliche Seiten, ohne technische oder private Bereiche zu indexieren.
Aktualisiert am 7 August 2026Was der Crawl erfasst – und was er ignorieren sollte
Die Quelle „Komplette Website“ durchsucht öffentliche Seiten derselben Domain, um daraus für den Assistenten nutzbare Textinhalte zu extrahieren. Sie ergänzt die leichte Analyse des Onboardings: Dieses bereitet das Profil vor, während der Crawl eine Basis individuell verfolgter Seiten erstellt.
Das erlaubte Volumen hängt vom Tarif und dem monatlichen URL-Kontingent ab. Wavize entdeckt Adressen, reiht sie ein, verarbeitet sie im Hintergrund und zeigt die Anzahl der gefundenen, erfolgreichen, ausgeschlossenen und fehlgeschlagenen Seiten an. Eine große Sitemap hebt nicht die Begrenzung Ihres Tarifs auf.
Sicherheitsbereich
Verwenden Sie nur öffentliche Seiten, deren Nutzung Ihr Unternehmen gestattet ist. Wavize blockiert private oder gefährliche Ziele und darf keine Verbindungen, Firewalls oder Anti-Robot-Challenges umgehen.
Eine Quelle für die komplette Website anlegen
Wählen Sie in der Wissensdatenbank die Option Komplette Website, geben Sie einen aussagekräftigen Titel ein und tragen Sie die kanonische URL ein.
Öffentliche Stamm-URL wählen
Bevorzugen Sie https://exemple.com oder die finale www-Variante. Vermeiden Sie eine Warenkorb-URL, eine temporäre Kampagne, eine private Subdomain oder eine Weiterleitung, die die Domain verlässt.
„Jetzt trainieren“ aktiviert lassen
Das Kontrollkästchen ist standardmäßig aktiviert. Es weist Wavize an, die Entdeckung und Indexierung nach dem Speichern zu starten. Deaktivieren Sie es nur, wenn Sie die Quelle vorbereiten, aber nicht sofort ausführen wollen.
Auf die Verarbeitung warten
Laden Sie nicht die Seite wiederholt und erstellen Sie die Quelle nicht neu. Der Status durchläuft verschiedene Phasen von Warteschlange und Verarbeitung; der Fortschritt entwickelt sich mit den Hintergrundaufgaben.
Verständnis von Entdeckung, Sitemap und Auswahl
Wavize kann Sitemaps nutzen und interne Links crawlen, behält dabei aber Schutzmechanismen und Prioritäten bei.
Seiten mit hohem Wert
Startseite, Dienstleistungen, Kategorien, Produkte, Hilfe, Versand, Rückgabe und Kontakt werden in der Regel priorisiert. Eine Seite sollte nützlichen Text enthalten, nicht nur eine Animation oder nach Interaktion geladene Blöcke.
Technische URLs
Schließen Sie Konto-, Login-, Warenkorb-, Zahlungs-, interne Such-, Tracking-Parameter, Vorschauen und endlose Filter aus. Diese erzeugen Duplikate oder zeigen Bildschirme ohne wertvolle Antworten an.
Kontingent und partielle Auswahl
Wenn die Entdeckung die Kapazität überschreitet, konzentrieren Sie sich auf die nützlichsten Seiten oder schließen Sie URL-Gruppen aus. Die absolute Sicherheitsgrenze garantiert nicht, dass alle URLs einer riesigen Website importiert werden.
URLs nach dem ersten Crawl steuern
Im Quellenprofil können gefundene Seiten gesucht, dauerhaft ausgeschlossen, wiederhergestellt und das Training neu gestartet werden.
Ausschluss ohne Kontrollverlust
Ein persistenter Ausschluss verhindert, dass die Seite beim nächsten Crawl zurückkehrt. Notieren Sie den Grund in Ihren internen Prozessen, besonders bei veralteten Richtlinien oder lokalen rechtlichen Bereichen.
Wiederherstellen und erneut trainieren
Eine URL wiederherzustellen macht sie erneut zulässig; starten Sie dann das Training neu und warten Sie die Verarbeitung ab, bevor Sie Informationen daraus testen.
Fehler mit Bedacht interpretieren
Die Tabelle zeigt die Gesamtanzahl fehlgeschlagener Seiten, liefert aber keine detaillierte Diagnose für jede URL. Testen Sie die Seite öffentlich und überprüfen Sie Weiterleitungen, HTTP-Status, Firewall und Inhalt, bevor Sie den Support kontaktieren.
Qualitätskontrolle eines Crawls
Ein abgeschlossener Crawl ist nur nützlich, wenn sein Umfang dem entspricht, was der Assistent kennen soll.
- Abdeckung — Finden Sie prioritäre kommerzielle und Support-Seiten in der Liste.
- Sauberkeit — Keine Warenkorb-, Konto- oder Massenfilter-Varianten dominieren die Ergebnisse.
- Getestete Antwort — Eine Frage greift explizite Fakten der bearbeiteten Seite auf, ohne erfundene Ergänzungen.
Antwort nicht gefunden?
Unser Team hilft Ihnen gern in Ihrem Kundenbereich.