PDF-tabell till CSV

PDF-tabell till CSV

Välj en textbaserad PDF

Gör om enkla, textbaserade PDF-tabeller till CSV- eller TSV-filer utan att skicka dokumentet till en server. Webbläsaren grupperar textfragment efter deras synliga position och söker efter återkommande kolumner. Kontrollera varje hittad tabell: det här är en försiktig ungefärlig detektor, inte en garanti för perfekta rader och kolumner i komplexa layouter.

Så extraherar du en PDF-tabell till CSV

  1. 1

    Välj en textbaserad PDF

    Välj en PDF på högst 20 MiB och 150 sidor. En skanning som bara innehåller bilder måste OCR-behandlas först.

  2. 2

    Låt webbläsaren hitta tabeller

    Detektorn använder textens synliga koordinater, inklusive sidrotation och CropBox, och söker efter upprepade rad- och kolumnpositioner.

  3. 3

    Granska och välj format

    Markera tabellerna du vill behålla och kontrollera raderna. Välj kommatecken, semikolon eller tabb, samt UTF-8-markör och formelskydd.

  4. 4

    Ladda ner valda tabeller

    Varje vald tabell skapas lokalt som en egen CSV- eller TSV-fil. Tabeller sammanfogas inte över flera sidor.

Vad detektorn kan återskapa

En PDF lagrar oftast en tabell som textfragment med koordinater, inte som ett verkligt rutnät av celler. Verktyget grupperar fragment på samma synliga rad, slår ihop närliggande delar och behåller kolumnpositioner som återkommer på flera rader. Regelbundna texttabeller fungerar bäst. Sammanslagna eller radbrutna celler och dekorativa layouter kan kräva manuell rättning.

Sidrotation och en förskjuten CropBox normaliseras. I rader som främst skrivs från höger till vänster följer kolumnordningen PDF-textlagrets riktning. Flera regelbundna tabeller på en sida kan hittas separat, men en tabell som fortsätter på nästa sida sammanfogas inte automatiskt.

PDF-layout Troligt resultat Kontrollera
Ren export med fasta kolumner Vanligen bästa fallet Rubriker, decimaltecken och tomma celler
Saknat värde i en regelbunden rad Tom cell i den uppskattade kolumnen Att rätt kolumn blev tom
Sammanslagen eller radbruten cell Text kan flyttas eller delas Jämför förhandsvisningen med PDF
Flera regelbundna tabeller på en sida Kan identifieras som separata numrerade tabeller En fil per vald tabell
Skannad sidbild Ingen tabell hittas Kör OCR först

Utöver gränserna 20 MiB och 150 sidor finns säkerhetsgränser för textfragment och tecken. En mycket fragmenterad PDF kan därför stoppas tidigare.

CSV, TSV och kalkylbladssäkerhet

Välj kommatecken eller semikolon för CSV, eller tabb för TSV. Poster avslutas med CRLF. Ett fält som innehåller den aktiva avgränsaren, dubbla citattecken, vagnretur eller radmatning omges av dubbla citattecken, och interna citattecken dubbleras. Det följer de vanliga reglerna i RFC 4180, anpassade till vald avgränsare.

Formelskydd är på som standard. Om en cell efter blanksteg börjar med =, +, - eller @, inklusive varianter med hel bredd som stöds, lägger verktyget till en apostrof. Värdet ändras, men kalkylbladet behandlar det oftare som text. Om skyddet stängs av bevaras råtexten, men formelliknande innehåll från en opålitlig PDF kan vara farligt. OWASP beskriver CSV Injection och varför inget skydd fungerar universellt.

En valfri UTF-8-markör hjälper vissa program att känna igen icke-latinsk text. Granska filen före bokföring, rapportering eller automatiserad import.

Privat stegstatus

PDF-filen, hittade tabeller och val stannar i den här webbläsaren. De lagras i ett begränsat lokalt utrymme i högst 30 minuter så att de tre stegen kan bevaras. Nedladdningar skapas lokalt och verktyget laddar inte upp något. Att börja om tar bort jobbet, och webbläsaren kan rensa data tidigare.

Vanliga frågor

Nej. Läsning, detektering och skapande av CSV eller TSV sker i webbläsaren. Jobbet finns i högst 30 minuter i begränsad lokal lagring och varje nedladdning är lokal.

Inte utan förbehandling. En bildskanning saknar ett textlager med positioner. Kör OCR först och använd sedan den textbaserade PDF-filen.

Välj kommatecken, semikolon eller tabb. Poster använder CRLF; fält med avgränsaren, citattecken eller radslut citeras och interna citattecken dubbleras. Tabb ger en .tsv-fil.

Det lägger till en apostrof i celler som efter blanksteg börjar med =, +, - eller @. Skyddet är på som standard och ändrar dessa värden. Stäng bara av det om råtexten behövs och du litar på PDF-filen.

Detekteringen använder textpositioner, inte riktiga celler. Radbrytningar, sammanslagningar, ovanliga avstånd och blandade skrivriktningar kan flytta värden. Jämför förhandsvisningen med källan.

Flera regelbundna tabeller på samma sida kan hittas och väljas separat. Varje val får en egen fil. En tabell som fortsätter på nästa sida sammanfogas inte.

Relaterade verktyg