PDF-sammanfattare

Steg 1 av 3

Öppnar den privata sammanfattningssessionen...

Välj en textbaserad PDF

Använd en PDF på högst 20 MiB och 150 sidor. Verktyget läser textlagret; skannade sidor behöver OCR.

eller släpp en PDF här

Laddar...

Stora dokument kan ta en stund. Du kan stoppa säkert utan att behålla ett delresultat.

sidor

Vill du snabbt få en första bild av en rapport, uppsats eller promemoria? Den här PDF-sammanfattaren läser textlagret som redan finns i filen och rangordnar meningar efter återkommande ord. Sedan visas de valda meningarna i den ordning de extraherades samt upp till 12 vanliga termer. Verktyget använder inte AI, skriver inte om dokumentet, faktagranskar inte och ersätter inte noggrann läsning. PDF-filen och den extraherade texten stannar i webbläsaren.

Så sammanfattar du en PDF

  1. 1

    Välj en textbaserad PDF

    Välj en riktig PDF på högst 20 MiB och 150 sidor. En skanning som bara består av sidbilder behöver först OCR.

  2. 2

    Extrahera texten i webbläsaren

    Verktyget läser det inbäddade textlagret lokalt och stannar över 2 000 000 extraherade tecken. Lösenordsskyddade, skadade och oläsliga filer avvisas.

  3. 3

    Ange längden

    Begär 3 till 20 meningar. Om dokumentet är kort visas alla tillgängliga meningar i stället för att ny text hittas på.

  4. 4

    Granska och kopiera

    Jämför de valda meningarna och vanliga termerna med den ursprungliga PDF-filen och kopiera sedan sammanfattningen till dina anteckningar.

Vad en extraktiv PDF-sammanfattning visar

En extraktiv sammanfattning behåller meningar ur källan i stället för att skriva ny text. Verktyget räknar betydelsebärande ord, ger meningar nära början en liten fördel, väljer det begärda antalet högt rankade meningar och återställer deras extraherade ordning.

Ett enkelt exempel

Anta att en projektrapport innehåller fyra meningar:

  1. Pilotprojektet minskade supportens genomsnittliga väntetid.
  2. Gruppen gjorde också om utbildningshandboken.
  3. Väntetiden sjönk igen efter den andra lanseringen.
  4. Rapporten rekommenderar att väntetiden följs varje månad.

Eftersom väntetid återkommer kan mening 1, 3 och 4 rankas högre än mening 2. Med tre meningar behåller resultatet ordningen 1, 3, 4. Verktyget skriver ingen ny slutsats och avgör inte om rapporten stämmer.

Vad webbläsaren gör

Steg Faktiskt beteende
PDF-läsning Läser det inbäddade textlagret med PDF.js; kör inte OCR
Meningsgränser Använder om möjligt Intl.Segmenter för sidans språk, annars Unicode-baserad skiljeteckenstolkning
Ordgränser Använder språkanpassad ordsegmentering och filtrerar en kort lokal lista med stoppord
Rangordning Poängsätter återkommande ord och ger tidiga meningar en liten positionsbonus
Resultat Behåller extraherad ordning och visar upp till 12 vanliga termer

Viktiga begränsningar

  • Textlagret styr resultatet. Spalter, tabeller, sidhuvuden, sidfötter och ovanliga teckenkodningar kan extraheras i en annan ordning än den synliga sidan.
  • Sidans språk styr segmenteringen. Verktyget analyserar inte hela dokumentet för att upptäcka språk. Om PDF-filen har ett annat språk kan uppdelning och rankning bli mindre träffsäkra.
  • Urval kan ta bort sammanhang. En korrekt återgiven mening kan bli missvisande utan stycket, tabellen eller förbehållet runt den.
  • Ingen faktagranskning. Verktyget rankar upprepning, inte bevis, motsägelser eller påståendens riktighet.
  • Fasta gränser. Högst 20 MiB, 150 sidor och 2 000 000 extraherade tecken.

Integritet i trestegsflödet

Käll-PDF-filen och den extraherade texten ligger kvar i webbläsarens lagring. Flödet hänvisar till den lokala posten med ett ogenomskinligt id i webbadressen och låter den upphöra efter 30 minuter. Sidan och PDF-biblioteket hämtar fortfarande vanliga resurser, men dessa anrop innehåller inte din PDF. Filen skickas varken till våra servrar eller till en konverteringstjänst.

Vanliga frågor

Nej. En deterministisk poäng baserad på ordfrekvens väljer meningar ur den extraherade texten. Inget språkmodell-anrop görs, texten parafraseras inte, nya påståenden skapas inte och fakta kontrolleras inte.

Inte på egen hand. En skanning med enbart sidbilder saknar ett inbäddat textlager. Kör först OCR och använd sedan den sökbara PDF-filen.

PDF-filer lagrar positionerad text i stället för vanliga stycken. Spalter, tabeller, upprepade sidhuvuden, sidfötter och vissa typsnitt kan ändra extraktionsordningen. Verktyget bevarar den ordningen, som inte alltid motsvarar den visuella läsordningen.

Webbläsaren delar meningar och ord enligt sidans aktuella språk, även för språk som inte sätter mellanslag mellan alla ord. En Unicode-baserad reserv finns, men PDF-filens språk upptäcks inte automatiskt. Bäst gränser fås när webbplatsens och dokumentets språk stämmer överens.

Använd en riktig PDF på högst 20 MiB, 150 sidor och 2 000 000 extraherade tecken. Lösenordsskyddade, skadade och oläsliga PDF-filer avvisas.

Nej. PDF-filen och texten stannar i webbläsaren. I trestegsflödet finns den privata posten i högst 30 minuter och webbadressen innehåller bara dess ogenomskinliga id. Vanliga sid- och biblioteksresurser hämtas utan din fil.

Relaterade verktyg