Du har 50 000 produktsidor. Google indexerar 8 000 av dem. Resterande 42 000 finns inte i sökresultatet — som om de inte existerade.
Det är crawl budget-problemet. Och om din sajt har över 10 000 URL:er är det troligen din största dolda SEO-flaskhals.
Den här guiden går igenom hur crawl budget faktiskt fungerar 2026, hur du läser dina serverloggar för att se vad Googlebot gör, och konkreta tekniker för att styra crawlen mot rätt sidor.
Vad crawl budget är (på riktigt)
Google har en daglig "budget" för hur mycket de crawlar varje sajt. Den bestäms av två faktorer:
1. Crawl rate limit
Hur snabbt Googlebot kan crawla din sajt utan att överbelasta servern. Snabba sajter → högre rate. Långsamma sajter → lägre rate (Google håller tillbaka för att inte krascha din site).
2. Crawl demand
Hur intresserad Google är av att crawla din sajt. Drivs av:
- Sajtens popularitet (länkar, varumärke)
- Innehållsuppdateringsfrekvens
- Hur "fräsch" de existerande sidorna är
Tillsammans: en sajt som är snabb + populär + uppdateras ofta får mer crawl budget. En långsam, lågprofilerad, stillastående sajt får mindre.
När crawl budget spelar roll
För sajter med:
- Under 1 000 URL:er — sällan ett problem. Google crawlar i princip allt.
- 1 000–10 000 URL:er — börjar bli relevant. Vissa sidor crawlas sällan.
- 10 000+ URL:er — kritiskt. Du måste prioritera vad Google ser.
- E-handel/marknadsplatser — extra kritiskt på grund av filterparametrar och faceted navigation.
Om din sajt är liten — fokusera på innehåll, inte crawl budget. Den här guiden är för dig om du har stor sajt eller hanterar e-handel/SaaS-marknadsplats.
Hur loggfiler visar Googlebots beteende
Serverloggar är en rad per request. Varje request från Googlebot ser ut ungefär så här:
66.249.66.1 - - [12/Jun/2026:10:24:31 +0200] "GET /produkt/sneaker-svart-42 HTTP/1.1" 200 14523 "-" "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)"
Det berättar:
- IP: 66.249.x.x = Googlebot (verifiera med reverse DNS — fake bots använder bara user-agent)
- Datum/tid: när requesten skedde
- URL: vilken sida som crawlades
- Statuskod: 200 (ok), 404 (saknas), 301 (redirect), 500 (fel)
- Bytes: hur stor responsen var
- User-agent: vilken bot
Verkliga loggfiler innehåller miljontals sådana rader per månad för stora sajter.
Hämta loggfiler
Beroende på hosting:
| Hosting | Var loggfiler finns |
|---|---|
| Apache (vanlig VPS) | /var/log/apache2/access.log |
| Nginx | /var/log/nginx/access.log |
| Cloudflare | Logpush till S3, GCS eller analytics-tjänst |
| Vercel | Vercel Logs (begränsad retention på lägre plans) |
| AWS CloudFront | S3 access logs |
| Shopify | Inte tillgängligt direkt (begränsning) |
För svenska sajter som driftas i molnet — be hostingleverantören aktivera log retention. Du behöver minst 30 dagar för meningsfull analys.
Verktyg för loggfilsanalys
Att läsa råa loggfiler manuellt är hopplöst. Du behöver verktyg:
| Verktyg | Pris | Bäst för |
|---|---|---|
| Screaming Frog Log File Analyser | £149/år | Klassiker, robust UI |
| Splunk | Enterprise | Stora datavolymer, real-time |
| ELK Stack (Elasticsearch + Logstash + Kibana) | Gratis (self-hosted) | Maximalt flexibel |
| OnCrawl | $300+/mån | Spec på SEO, integrerad med crawls |
| GoAccess | Gratis | Terminal-baserat, snabbt för engångsanalys |
För svenska SMB-sajter: Screaming Frog Log File Analyser är bäst kombination av pris och funktion.
Vad du letar efter i loggar
1. Vad crawlas mest?
Sortera URL:er efter antal Googlebot-besök. Förvänta dig:
- Hemsidan toppar (rätt)
- Topp-kategorisidor (rätt)
- Sitemap.xml (rätt)
Röda flaggor:
- Lågvärdiga filter-URL:er (
?filter=storlek-42&färg=svart) crawlas tusentals gånger - Adminsidor eller test-sidor
- Bortglömda gamla landningssidor
- 404-sidor crawlas upprepat (Google försöker fortfarande indexera dem)
2. Vad crawlas inte alls?
Jämför loggar mot din XML sitemap. URL:er som finns i sitemap men aldrig crawlas — kritiska sidor som Google missar.
Vanliga orsaker:
- Sitemap-fel (broken format, för stor)
- Dålig intern länkning till sidan
- Lågt PageRank (för få inkommande länkar)
- Crawl budget gått till annat skräp
3. Statuskoder
Räkna fördelning av statuskoder från Googlebot:
200 OK: 65% (bra)
301 Permanent: 8% (acceptabelt)
302 Temporary: 2% (varning — bör vara 301)
304 Not Modified: 12% (bra — cache fungerar)
404 Not Found: 10% (för högt!)
500 Server Error: 1% (försumbart)
503 Unavailable: 2% (kan vara problem)
Tumregel: 404 över 5% är slöseri med crawl budget. Fixa de mest crawlade 404:orna först.
4. Crawl-frekvens per sektion
Dela upp loggar per URL-mönster:
/produkt/* 8 234 crawls/dag (hög, bra)
/blogg/* 412 crawls/dag (medel)
/kollektion/* 2 891 crawls/dag (bra)
/sok?q=* 3 102 crawls/dag (SLÖSERI — blockera)
/admin/* 47 crawls/dag (för många — blockera)
/api/* 829 crawls/dag (SLÖSERI — blockera)
Tomma sökresultat-sidor, API-endpoints, admin = bör inte crawlas alls.
Konkret optimering: styra crawl budget
Åtgärd 1: Robots.txt-blockering
Stoppa Googlebot från att crawla onödiga URL-mönster:
# /robots.txt
User-agent: Googlebot
Disallow: /sok
Disallow: /api/
Disallow: /admin/
Disallow: /*?filter=
Disallow: /*?sort=
Disallow: /cart
Disallow: /checkout
OBS: disallow är inte samma som noindex. Disallowade sidor crawlas inte alls — vilket är vad du vill för crawl budget. För sidor som redan är indexerade men du vill ta bort: använd noindex först, vänta tills de tas bort, sen disallow.
Åtgärd 2: noindex på tunna sidor
Sidor som finns men inte ska indexeras:
- Filter-kombinationer med få produkter
- Paginerade sidor (page 5+ i listor)
- Tagg-arkiv med 1–2 inlägg
- Användarprofiler utan content
<meta name="robots" content="noindex,follow">
follow säkerställer att Google fortfarande följer länkar från sidan.
Åtgärd 3: Canonical-tags
Duplicerat content från filter-URL:er:
<!-- /produkter?färg=svart -->
<link rel="canonical" href="https://exempel.se/produkter">
Talar om att den filtrerade versionen är dubbletten — original-URL:en är canonical.
Åtgärd 4: Snabbare server-respons
Crawl rate limit höjs när servern svarar snabbt. Förbättra:
- TTFB (Time To First Byte) under 200ms
- CDN för statiska assets
- Database query-optimering
- Caching på server-nivå
Mer i vår Core Web Vitals-guide.
Åtgärd 5: XML sitemap-prioritering
Lägg bara viktiga sidor i din sitemap. Google prioriterar URL:er i sitemap för crawl.
<url>
<loc>https://exempel.se/produkter/topplista/</loc>
<lastmod>2026-06-12</lastmod>
<changefreq>daily</changefreq>
<priority>1.0</priority>
</url>
Tumregel: sitemap < 50 000 URL:er. Större? Dela upp i flera sitemap-filer med sitemap-index.
Åtgärd 6: Internlänkning från höga sidor
Sidor djupt i navigationen får sällan crawl. Lägg interna länkar från hemsida eller toppkategorier till viktiga djupa sidor.
Mer om intern länkning i vår guide.
Search Console: kompletterande data
Loggfiler ger råa data. Search Console ger Google-processerad data:
Settings → Crawl Stats visar:
- Totala crawl-requests per dag
- Genomsnittlig responstid
- Filtyper (HTML, CSS, JS, bilder)
- Respons-koder
Tänk på: Search Console visar bara ett sample (10–20%) av total crawl-aktivitet. Loggfiler visar 100%.
Använd Search Console för trender. Använd loggfiler för specifik analys.
E-handels-specifikt: faceted navigation
Värsta crawl budget-tjuven på e-handel: filterkombinationer.
/produkter
/produkter?färg=svart
/produkter?färg=svart&storlek=42
/produkter?färg=svart&storlek=42&märke=nike
/produkter?färg=svart&storlek=42&märke=nike&pris=500-1000
Fyra filter med 5 alternativ var = 625 URL-kombinationer per kategori. Multiplicera med 50 kategorier = 31 250 låg-värde-URL:er som suger crawl budget.
Hantering:
- Disallow filter-parametrar i robots.txt
- Canonical till basekategori
- AJAX-filter (uppdatera UI utan ny URL)
- Noindex på filtervarianter
Mer i vår e-handels-SEO-guide.
Vanliga misstag
-
Disallow utan att tänka noindex först. Sidor blir kvar i Googles index men inte längre crawlas. Ofta visas de fel med fel snippet.
-
Sitemap med 500 000 URL:er. Google läser den inte alls om den är trasig eller oöverskådlig.
-
Antar att Google crawlar allt. Stora sajter — Google crawlar bara ~30–60% av alla URL:er. Resten måste du explicit prioritera.
-
Ignorerar 5xx-fel. Tillfälliga 500/503 från Googlebot betyder serverproblem just när Google försökte komma. Förlorade crawl-tillfällen.
-
Tror att höj crawl rate-knappen i Search Console hjälper. Den finns inte längre (utfasad 2025). Servern bestämmer.
Snabb checklista
- Loggfiler hämtas och bevaras 30+ dagar
- Analysverktyg konfigurerat (Screaming Frog LFA, OnCrawl, eller ELK)
- Topp 100 mest-crawlade URL:er identifierade
- Sitemap-vs-loggar-jämförelse gjord (missade sidor)
- Statuskodsfördelning under kontroll (404 <5%)
- Robots.txt blockerar lågvärde-mönster
- Noindex på tunna sidor
- Canonical implementerat på filter-URL:er
- Search Console Crawl Stats övervakas månadsvis
- TTFB under 200ms
Det här på 30 sekunder
Crawl budget är endast ett problem på stora sajter — men där är det ett ENORMT problem. Hämta loggfiler. Hitta vad Google slösar tid på. Blockera skräp-URL:er i robots.txt. Optimera sitemap för att visa Google rätt prioriteringar. För e-handel: hantera faceted navigation.
Crawl budget-arbete är en teknisk SEO-disciplin som ofta lönar sig 10x mer än fler artiklar — för stora sajter. För mindre sajter: fokusera på content (där Ranqo hjälper dig). Logga in på Ranqo.