Ücretsiz başla
Docs / RAG Widget / Bilgi tabanı oluşturma
How-to

Bilgi tabanı oluşturma

Widget'ınızın cevapları yalnızca bilgi tabanınızdan gelir. Bu rehber, bir bilgi tabanını sıfırdan nasıl kuracağınızı gösterir: web sitenizi tarayarak, forum ve dosya kaynakları ekleyerek, güncel tutarak ve kaliteyi yükselterek.

🎯

Amaç: Widget bir soruya cevap verirken uydurmaz — bulduğu kaynağı gösterir, bulamazsa "bilmiyorum" der (strict-KB grounding). İyi bir bilgi tabanı = iyi cevaplar. Bu yüzden kaynak seçimi ve kalite döngüsü önemlidir.

1. Web sitenizi ekleyin (crawl)

En hızlı yol: site adresinizi verip taramayı başlatmak. SemAgent iki yolla sayfa keşfeder:

  • Sitemap — sitenizde sitemap.xml varsa, listelenen tüm URL'ler alınır (en temiz yöntem).
  • BFS link takibi — sitemap yoksa, verdiğiniz adresten başlayıp iç linkleri genişleyerek (breadth-first) sayfaları keşfeder.

Bilgi tabanı panelinden Kaynak ekle → Web sitesi deyip başlangıç URL'sini girin. Kapsamı daraltmak için url_include desenleri kullanın — örneğin yalnız yardım merkezini taramak:

Başlangıç URL:  https://ornek.com/
Yalnız şu yolları dahil et (url_include):
  /yardim/
  /sss/
  /blog/

Dar başlayın. Önce yardım/SSS sayfalarını tarayın, cevap kalitesini görün, sonra kapsamı genişletin. Tüm siteyi tek seferde taramak gürültü (menü, footer, kampanya sayfaları) ekleyebilir.

2. Forum kaynağı ekleyin (opsiyonel)

Topluluk forumunuz varsa, SemAgent 5 forum motorunu otomatik algılar: phpBB, inSided, Discourse, XenForo, vBulletin. Forum URL'sini kaynak olarak ekleyin; motor tanınır ve konular ayrıştırılır.

  • Yalnız cevaplanmış konular (only_answered) filtresini açık tutun — çözülmemiş/spam başlıklar bilgi tabanını kirletmesin.
  • Forum içeriği çoğu zaman en değerli kaynaktır: gerçek müşteri sorularının gerçek çözümleri.

3. Dosya yükleyin

Web'de olmayan içerik için — ürün kılavuzları, politika belgeleri, fiyat listeleri — dosyaları doğrudan yükleyin. Desteklenen türler: PDF, Word, düz metin. Yüklenen dosyalar diğer kaynaklarla aynı şekilde parçalanıp indexlenir.

4. Taramayı başlatın ve izleyin

Kaynakları ekledikten sonra taramayı başlatın. Tarama sırasında ve sonrasında crawl log'u izleyebilirsiniz — her satır bir sayfayı ve sebebini gösterir:

DurumAnlamı
AlındıSayfa indexlendi.
AtlandıKapsam dışı (url_include eşleşmedi), yinelenen veya boş içerik.
HataErişilemedi (404, zaman aşımı, bot engeli) — sebep yazılıdır.

"Neden bu sayfa indexlenmedi?" sorusunun cevabı her zaman bu logdadır. Uzun taramalar kesilirse checkpoint/resume sayesinde kaldığı yerden devam eder — baştan başlamaz.

5. Bot-korumalı siteler (stealth)

Kendi siteniz Cloudflare gibi bir bot korumasının arkasındaysa, standart tarama 403 alabilir. Bu durumda SemAgent stealth taramaya geçer: gerçek tarayıcı parmak iziyle (camoufox) ve proxy havuzu üzerinden erişir.

🔒

Stealth yalnızca kendi sahibi olduğunuz siteleri taramak içindir. Başkasının bot korumasını aşmak için kullanmayın — kullanım koşullarına aykırıdır.

6. Güncel tutun (zamanlanmış re-crawl)

İçeriğiniz değiştikçe bilgi tabanı bayatlar. Zamanlanmış yeniden tarama ile kaynakları belirli aralıklarla otomatik tazeleyin (ör. haftalık). Böylece widget her zaman güncel fiyat/politika/ürün bilgisini verir.

7. Kaliteyi yükseltin (döngü)

Bilgi tabanı bir kez kurulup bırakılan değil, beslenen bir şeydir. İki araç bu döngüyü kolaylaştırır:

  • Cevap test hattı — yayına almadan örnek soruları çalıştırın; hangi cevabın hangi kaynaktan geldiğini görün.
  • Cevapsız-soru raporu — widget'ın cevaplayamadığı gerçek müşteri soruları panelde birikir. Bu liste, bilgi tabanınızın yol haritasıdır: her cevapsız soru için bir kaynak ekleyin.
🔁

Sağlıklı döngü: Yayınla → cevapsız-soru raporunu oku → eksik içeriği ekle/kaynak tara → tekrar test et. Birkaç hafta içinde cevaplanma oranınız belirgin yükselir.

8. Düzenleyin (KB klasörleri)

Çok sayıda kaynak biriktiğinde, bunları klasörlerle gruplayabilirsiniz (ör. "Ürünler", "İade politikası", "SSS"). Klasörler organizasyoneldir — arama/retrieval davranışını değiştirmez, yalnızca yönetimi kolaylaştırır.

Sonraki adımlar

  • Araç referansıkb_search ve grounding'in ajan tarafında nasıl kullanıldığı.
  • Widget kurulum & persona (yakında) — bilgi tabanınızı canlı widget'a bağlama.
  • Cevap kalitesi & grounding (yakında) — chunk'lama, hibrit arama ve strict-KB'nin iç işleyişi.
Bu sayfa yardımcı oldu mu? Geri bildirim gönder