PDF-tabell till CSV
Välj en textbaserad PDF
Gör om enkla, textbaserade PDF-tabeller till CSV- eller TSV-filer utan att skicka dokumentet till en server. Webbläsaren grupperar textfragment efter deras synliga position och söker efter återkommande kolumner. Kontrollera varje hittad tabell: det här är en försiktig ungefärlig detektor, inte en garanti för perfekta rader och kolumner i komplexa layouter.
Så extraherar du en PDF-tabell till CSV
-
1
Välj en textbaserad PDF
Välj en PDF på högst 20 MiB och 150 sidor. En skanning som bara innehåller bilder måste OCR-behandlas först.
-
2
Låt webbläsaren hitta tabeller
Detektorn använder textens synliga koordinater, inklusive sidrotation och CropBox, och söker efter upprepade rad- och kolumnpositioner.
-
3
Granska och välj format
Markera tabellerna du vill behålla och kontrollera raderna. Välj kommatecken, semikolon eller tabb, samt UTF-8-markör och formelskydd.
-
4
Ladda ner valda tabeller
Varje vald tabell skapas lokalt som en egen CSV- eller TSV-fil. Tabeller sammanfogas inte över flera sidor.
Vad detektorn kan återskapa
En PDF lagrar oftast en tabell som textfragment med koordinater, inte som ett verkligt rutnät av celler. Verktyget grupperar fragment på samma synliga rad, slår ihop närliggande delar och behåller kolumnpositioner som återkommer på flera rader. Regelbundna texttabeller fungerar bäst. Sammanslagna eller radbrutna celler och dekorativa layouter kan kräva manuell rättning.
Sidrotation och en förskjuten CropBox normaliseras. I rader som främst skrivs från höger till vänster följer kolumnordningen PDF-textlagrets riktning. Flera regelbundna tabeller på en sida kan hittas separat, men en tabell som fortsätter på nästa sida sammanfogas inte automatiskt.
| PDF-layout | Troligt resultat | Kontrollera |
|---|---|---|
| Ren export med fasta kolumner | Vanligen bästa fallet | Rubriker, decimaltecken och tomma celler |
| Saknat värde i en regelbunden rad | Tom cell i den uppskattade kolumnen | Att rätt kolumn blev tom |
| Sammanslagen eller radbruten cell | Text kan flyttas eller delas | Jämför förhandsvisningen med PDF |
| Flera regelbundna tabeller på en sida | Kan identifieras som separata numrerade tabeller | En fil per vald tabell |
| Skannad sidbild | Ingen tabell hittas | Kör OCR först |
Utöver gränserna 20 MiB och 150 sidor finns säkerhetsgränser för textfragment och tecken. En mycket fragmenterad PDF kan därför stoppas tidigare.
CSV, TSV och kalkylbladssäkerhet
Välj kommatecken eller semikolon för CSV, eller tabb för TSV. Poster avslutas med CRLF. Ett fält som innehåller den aktiva avgränsaren, dubbla citattecken, vagnretur eller radmatning omges av dubbla citattecken, och interna citattecken dubbleras. Det följer de vanliga reglerna i RFC 4180, anpassade till vald avgränsare.
Formelskydd är på som standard. Om en cell efter blanksteg börjar med =, +, - eller @, inklusive varianter med hel bredd som stöds, lägger verktyget till en apostrof. Värdet ändras, men kalkylbladet behandlar det oftare som text. Om skyddet stängs av bevaras råtexten, men formelliknande innehåll från en opålitlig PDF kan vara farligt. OWASP beskriver CSV Injection och varför inget skydd fungerar universellt.
En valfri UTF-8-markör hjälper vissa program att känna igen icke-latinsk text. Granska filen före bokföring, rapportering eller automatiserad import.
Privat stegstatus
PDF-filen, hittade tabeller och val stannar i den här webbläsaren. De lagras i ett begränsat lokalt utrymme i högst 30 minuter så att de tre stegen kan bevaras. Nedladdningar skapas lokalt och verktyget laddar inte upp något. Att börja om tar bort jobbet, och webbläsaren kan rensa data tidigare.
Vanliga frågor
Nej. Läsning, detektering och skapande av CSV eller TSV sker i webbläsaren. Jobbet finns i högst 30 minuter i begränsad lokal lagring och varje nedladdning är lokal.
Inte utan förbehandling. En bildskanning saknar ett textlager med positioner. Kör OCR först och använd sedan den textbaserade PDF-filen.
Välj kommatecken, semikolon eller tabb. Poster använder CRLF; fält med avgränsaren, citattecken eller radslut citeras och interna citattecken dubbleras. Tabb ger en .tsv-fil.
Det lägger till en apostrof i celler som efter blanksteg börjar med =, +, - eller @. Skyddet är på som standard och ändrar dessa värden. Stäng bara av det om råtexten behövs och du litar på PDF-filen.
Detekteringen använder textpositioner, inte riktiga celler. Radbrytningar, sammanslagningar, ovanliga avstånd och blandade skrivriktningar kan flytta värden. Jämför förhandsvisningen med källan.
Flera regelbundna tabeller på samma sida kan hittas och väljas separat. Varje val får en egen fil. En tabell som fortsätter på nästa sida sammanfogas inte.
Relaterade verktyg
Excel till PDF-konverterare
Konvertera XLSX-, XLS- eller CSV-filer i webbläsaren till en liggande A4-PDF. Varje kalkylblad blir en tydlig tabellsida.
PNG till PDF-konverterare
Samla PNG-skärmbilder, skanningar eller designexporter i en PDF. Välj A4 eller Letter, orientering och marginaler före nedladdning.
PDF till JPG-konverterare
Konvertera PDF-sidor till JPG-bilder med den upplösning och kvalitet du behöver. Ladda ner enskilda sidor eller allt som en ZIP.
PDF till Excel-konverterare
Upptäck vanliga tabeller i en textbaserad PDF och ladda ner XLSX, CSV eller TSV lokalt. Granska tabellerna före export. Gräns: 20 MiB och 150 sidor.
Word till PDF
Konvertera Word-dokument i .doc och .docx till PDF med sidlayout, bilder, tabeller och rubriker bevarade. Säker uppladdning, automatisk radering efter 2 timmar.
Slå ihop PDF
Slå ihop flera PDF-filer, ordna filer och sidor med dra och släpp och ladda ned det färdiga dokumentet direkt.