Allt om att använda reguljära uttryck i calibre¶
Reguljära uttryck används på många ställen i calibre för avancerad bearbetning av e-böckers innehåll och metadata. Den här handledningen ger en lättillgänglig introduktion som hjälper dig att komma igång med reguljära uttryck i calibre.
Först några varnande och uppmuntrande ord¶
Detta blir ofrånkomligen ganska tekniskt – reguljära uttryck är trots allt ett tekniskt verktyg för tekniska uppgifter. Jag behöver använda en del facktermer och begrepp som kan verka komplicerade eller invecklade. Jag ska försöka förklara dem så tydligt som möjligt, men kan inte helt undvika dem. Låt dig därför inte avskräckas av facktermerna; jag har försökt förklara allt nytt. Reguljära uttryck kan verka som svårbegriplig svartkonst – eller, mer prosaiskt, som en slumpmässig blandning av bokstäver och tecken – men jag lovar att de inte är så komplicerade. Även den som behärskar reguljära uttryck väl kan ha svårt att läsa de mer avancerade, men det är inte lika svårt att skriva dem: du bygger uttrycket steg för steg. Ta därför första steget och följ med ner i kaninhålet.
Var i calibre kan man använda reguljära uttryck?¶
calibre använder reguljära uttryck på flera ställen: i Sök och ersätt bland konverteringsalternativen, vid identifiering av metadata från filnamn i importinställningarna och i Sök och ersätt vid massredigering av metadata. Bokredigeraren använder också reguljära uttryck i funktionen Sök och ersätt. Slutligen kan du använda dem när du söker i calibres boklista och i e-bokvisaren.
Vad i hela världen är ett reguljärt uttryck?¶
Ett reguljärt uttryck är ett sätt att beskriva mängder av strängar. Ett enda reguljärt uttryck kan matcha flera olika strängar. Det är detta som gör reguljära uttryck så kraftfulla: de beskriver ett potentiellt stort antal variationer på ett kortfattat sätt.
Anteckning
Här använder jag ordet sträng i samma betydelse som i programspråk: en följd av ett eller flera tecken, till exempel bokstäver, siffror, skiljetecken och så kallade blanktecken (radbrytningar, tabulatorer osv.). Observera att stora och små bokstäver vanligtvis räknas som olika tecken: ”a” skiljer sig alltså från ”A” och så vidare. I calibre är reguljära uttryck skiftlägesokänsliga i sökfältet, men inte bland konverteringsalternativen. Det går att göra varje reguljärt uttryck skiftlägesokänsligt, men det återkommer vi till senare. Det blir mer komplicerat eftersom reguljära uttryck tillåter variationer i strängarna de matchar. Ett uttryck kan alltså matcha flera strängar, vilket är själva poängen med att använda dem. Mer om det strax.
Har du lust att förklara?¶
Det är därför vi är här. Först det viktigaste begreppet i reguljära uttryck: En sträng är i sig ett reguljärt uttryck som matchar sig självt. Om jag vill matcha strängen "Hello, World!" med ett reguljärt uttryck använder jag alltså Hello, World!. Ja, så enkelt är det. Observera dock att detta endast matchar den exakta strängen "Hello, World!", inte till exempel "Hello, wOrld!" eller "hello, world!" eller någon annan sådan variant.
Det låter inte så illa. Vad kommer härnäst?¶
Nu börjar det bli riktigt användbart. Minns du att reguljära uttryck kan matcha flera strängar? Här blir det lite mer komplicerat. Som ett mer praktiskt exempel kan vi tänka oss att e-boken du vill konvertera har en störande sidfot med sidnummer, till exempel ”Page 5 of 423”. Sidnumret varierar från 1 till 423, så du skulle behöva matcha 423 olika strängar, eller hur? Faktiskt inte: reguljära uttryck låter dig definiera teckenuppsättningar. Du skriver alla tecken som ska ingå i uppsättningen inom hakparenteser. Uppsättningen [abc] matchar till exempel tecknet ”a”, ”b” eller ”c”. En teckenuppsättning matchar alltid endast ett av tecknen i uppsättningen. Den stöder också teckenintervall: [a-z] matchar gemener och [a-zA-Z] matchar både gemener och versaler, och så vidare. Förstår du principen? Uttrycket Page [0-9] of 423 matchar de första nio sidorna, vilket minskar antalet uttryck som behövs till tre. Det andra uttrycket, Page [0-9][0-9] of 423, matchar alla tvåsiffriga sidnummer. Du kan säkert gissa hur det tredje uttrycket ska se ut. Prova att skriva ner det.
Snyggt! Nu börjar det klarna!¶
Jag hoppades att du skulle säga det. Men håll i dig, för nu blir det ännu bättre! Vi såg nyss att en teckenuppsättning kan matcha ett av flera tecken samtidigt. Du kan dessutom upprepa ett tecken eller en teckenuppsättning och därmed minska antalet uttryck som behövs för sidnummerexemplet ovan till ett enda. Ja, ETT! Visst är det spännande? Så här fungerar det: Specialtecknen ”+”, ”?” och ”*” upprepar det enskilda element som står närmast före dem. Ett element kan vara ett enskilt tecken, en teckenuppsättning, en escape-sekvens eller en grupp (vi återkommer till de två sistnämnda senare) – kort sagt en enskild enhet i ett reguljärt uttryck. Tecknen kallas jokertecken eller kvantifierare. Mer exakt matchar ”?” 0 eller 1 förekomst av det föregående elementet, ”*” matchar 0 eller flera och ”+” matchar 1 eller flera. Några exempel: Uttrycket a? matchar antingen ”” (den tomma strängen, som inte är särskilt användbar i just detta fall) eller ”a”. Uttrycket a* matchar ””, ”a”, ”aa” eller valfritt antal a i följd. Slutligen matchar a+ ”a”, ”aa” eller valfritt antal a i följd (observera att det inte matchar den tomma strängen). Detsamma gäller teckenuppsättningar: Uttrycket [0-9]+ matchar vilket heltal som helst! Jag vet vad du tänker, och du har rätt: Om du använder det i sidnummerexemplet ovan, blir inte detta då det enda uttryck som behövs för att matcha alla sidnummer? Jo, uttrycket Page [0-9]+ of 423 matchar varje sidnummer i boken!
Anteckning
En kommentar om dessa kvantifierare: De försöker i allmänhet matcha så mycket text som möjligt, så var försiktig när du använder dem. Detta kallas ”girigt beteende”, och du förstår säkert varför. Det blir problematiskt om du till exempel försöker matcha en tagg. Betrakta strängen "<p class="calibre2">Title here</p>" och anta att du vill matcha öppningstaggen (delen mellan det första paret vinkelparenteser; vi återkommer till taggar senare). Man skulle kunna tro att <p.*> matchar den taggen, men uttrycket matchar faktiskt hela strängen! (Tecknet ”.” är ett annat specialtecken. Det matchar allt utom radbrytningar, så .* matchar i princip vilken enskild rad som helst.) Använd i stället <p.*?> för att göra kvantifieraren "*" icke-girig. Då matchas endast den första öppningstaggen, som avsett. Det finns även ett annat sätt: <p[^>]*> matchar samma öppningstagg. Efter nästa avsnitt förstår du varför. Kom ihåg att det ofta finns flera sätt att skriva ett reguljärt uttryck.
De här specialtecknen är praktiska, men hur matchar jag en punkt eller ett frågetecken?¶
Det kan du naturligtvis göra. Sätt bara ett omvänt snedstreck framför ett specialtecken, så tolkas det som det bokstavliga tecknet utan någon särskild betydelse. Ett omvänt snedstreck följt av ett enda tecken kallas en escape-sekvens, och att sätta ett omvänt snedstreck framför ett specialtecken kallas att maskera tecknet. En escape-sekvens tolkas som ett enda element. Det finns även escape-sekvenser som gör mer än att bara maskera specialtecken; "\t" betyder till exempel en tabulator. Vi återkommer till några av escape-sekvenserna senare. Betrakta för övrigt alla tecken som beskrivs som specialtecken i den här introduktionen som tecken med en särskild funktion, vilket innebär att de måste maskeras när du vill matcha själva tecknet.
Så, vilka är de användbaraste uppsättningarna?¶
Jag visste att du skulle fråga. Några användbara teckenuppsättningar är [0-9], som matchar en enda siffra, [a-z], som matchar en enda gemen, [A-Z], som matchar en enda versal, [a-zA-Z], som matchar en enda bokstav, och [a-zA-Z0-9], som matchar en enda bokstav eller siffra. Du kan också använda en escape-sekvens som kortform:
\dmotsvarar
[0-9]\wmotsvarar
[a-zA-Z0-9_]\smotsvarar valfritt blanktecken
Anteckning
”Blanktecken” är en term för tecken som inte ger något synligt tecken vid utskrift. Dit hör mellanslag, tabulator, radmatning, sidmatning, vagnretur, fast mellanslag med flera.
Anteckning
Uppsättningarna för versaler och gemener kan matcha båda skiftlägena om skiftlägesokänslig sökning är aktiverad. Sådana inställningar finns till exempel under Inställningar->Sökning i calibre, i sökpanelen i calibres e-bokvisare och i verktyget Redigera bok.
Som en sista anmärkning om teckenuppsättningar kan du definiera en uppsättning som matchar alla tecken utom dem som ingår i uppsättningen. Det gör du genom att placera tecknet "^" som det allra första tecknet i uppsättningen. [^a] matchar alltså alla tecken utom ”a”. Detta kallas att komplementera uppsättningen. De kortformer med escape-sekvenser som vi såg tidigare kan också komplementeras: "\D" betyder ett valfritt tecken som inte är en siffra och motsvarar därför [^0-9]. De andra kortformerna komplementeras genom att den gemena bokstaven byts mot motsvarande versal. I exemplet <p[^>]*> från föregående avsnitt försöker teckenuppsättningen alltså matcha alla tecken utom en avslutande vinkelparentes.
Men blir det inte komplicerat om jag vill matcha flera olika strängar?¶
Ingen fara, det är fortfarande ganska enkelt. Tänk dig att boken du konverterar har ”Titel” på varje udda sida och ”Författare” på varje jämn sida. Det ser bra ut i tryck, men är irriterande i en e-bok. Du kan gruppera hela uttryck inom vanliga parenteser, och tecknet "|" låter dig matcha antingen uttrycket till höger eller det till vänster. Kombinera dessa två funktioner, så är du klar. Gick det för fort? Först grupperar vi uttrycken för udda och jämna sidor och får (Titel)(Författare). Sedan förenklar vi med det lodräta strecket (tecknet "|"): Uttrycket (Titel|Författare) matchar antingen ”Titel” på de udda sidorna eller ”Författare” på de jämna. Visst var det enkelt?
Du kan naturligtvis också använda det lodräta strecket utan grupperingsparenteser. Minns du att kvantifierare upprepar elementet framför dem? Det lodräta strecket fungerar annorlunda: Uttrycket ”Titel|Författare” matchar antingen strängen ”Titel” eller strängen ”Författare”, precis som i grupperingsexemplet ovan. Det lodräta strecket väljer mellan hela uttrycket före och hela uttrycket efter strecket. Om du vill matcha strängarna ”Calibre” och ”calibre” och bara välja mellan versalt och gement ”c” måste du därför använda uttrycket (c|C)alibre. Grupperingen gör att endast ”c” väljs. Med c|Calibre skulle uttrycket i stället matcha strängen ”c” eller strängen ”Calibre”. Kort sagt: använd gruppering tillsammans med det lodräta strecket när du är osäker.
Du missade…¶
… vänta lite, det finns en sista riktigt användbar sak du kan göra med grupper. Om du tidigare har matchat en grupp kan du hänvisa till den senare i uttrycket. Grupperna numreras från 1, och du hänvisar till en grupp genom att skriva ett omvänt snedstreck framför gruppnumret. Den femte gruppen anges alltså som \5. Om du söker efter ([^ ]+) \1 i strängen ”Test Test” matchas hela strängen!
I början sa du att det fanns ett sätt att göra ett reguljärt uttryck skiftlägesokänsligt?¶
Ja, tack för påminnelsen. Med så kallade flaggor kan du ange hur calibre ska behandla uttrycket. Flaggor skrivs med konstruktionen (?flags go here), där texten ersätts med de flaggor du vill använda. Flaggan i gör matchningen skiftlägesokänslig, så du skriver (?i) i uttrycket. (?i)test matchar exempelvis ”Test”, ”tEst”, ”TEst” och andra skiftlägesvarianter.
En annan användbar flagga, s, gör att punkten matchar alla tecken, även radbrytningar. Om du vill använda flera flaggor i ett uttryck placerar du dem i samma konstruktion: (?is) gör sökningen skiftlägesokänslig och låter punkten matcha alla tecken. Flaggornas ordning spelar ingen roll; (?si) motsvarar alltså uttrycket ovan.
Jag tror jag börjar förstå dessa reguljära uttryck nu… hur använder jag dem i calibre?¶
Konverteringar¶
Vi börjar med konverteringsinställningarna. Under Sök och ersätt kan du ange ett reguljärt uttryck som beskriver den text som ska ersättas under konverteringen. Det praktiska är guiden. Klicka på trollstaven för att visa en förhandsgranskning av det calibre ser under konverteringen. Bläddra till texten du vill ta bort, markera och kopiera den och klistra sedan in den i fältet för reguljära uttryck högst upp i fönstret. Om texten innehåller varierande delar, till exempel sidnummer, använder du teckenuppsättningar och kvantifierare för att matcha dem. Kom också ihåg att föregå specialtecken med ett omvänt snedstreck. Klicka på Test så markerar calibre de delar som skulle ersättas. När du är nöjd klickar du på OK och genomför konverteringen. Var försiktig om konverteringskällan innehåller taggar som i följande exempel:
Maybe, but the cops feel like you do, Anita. What's one more dead vampire?
New laws don't change that. </p>
<p class="calibre4"> <b class="calibre2">Generated by ABC Amber LIT Conv
<a href="http://www.processtext.com/abclit.html" class="calibre3">erter,
http://www.processtext.com/abclit.html</a></b></p>
<p class="calibre4"> It had only been two years since Addison v. Clark.
The court case gave us a revised version of what life was
(skamlöst hämtat från denna tråd). Du måste även ta bort några av taggarna. I det här exemplet rekommenderar jag att du börjar med taggen <b class="calibre2">. Därefter måste uttrycket avslutas med motsvarande sluttagg (öppningstaggar skrivs <tag> och sluttaggar </tag>), vilket i detta fall helt enkelt är nästa </b>. (Läs en bra HTML-handbok eller fråga i forumet om detta är oklart.) Öppningstaggen kan beskrivas med <b.*?> och sluttaggen med </b>. Vi skulle alltså kunna ta bort allt mellan taggarna med <b.*?>.*?</b>. Det är dock en dålig idé att använda det uttrycket, eftersom det tar bort allt som omges av <b>-taggar (vilka för övrigt visar den omslutna texten med fetstil), och då riskerar vi att ta bort delar av boken. Ta därför även med början av den omslutna strängen och använd det reguljära uttrycket <b.*?>\s*Generated\s+by\s+ABC\s+Amber\s+LIT.*?</b>. Här används \s tillsammans med kvantifierare i stället för de uttryckliga blanksteg som syns i strängen, så att eventuella variationer av strängen också fångas. Kontrollera alltid vad calibre tänker ta bort när du provar ett nytt uttryck, så att du inte råkar ta bort något du vill behålla. Om du bara kontrollerar en förekomst kan du missa en felaktig matchning någon annanstans i texten. Observera också att calibre försöker reparera den skadade koden efter borttagningen om du av misstag tar bort fler eller färre taggar än avsett.
Lägga till böcker¶
Du kan också använda reguljära uttryck för att extrahera metadata från filnamn. Funktionen finns under ”Lägga till böcker” i inställningarna. Här finns en särskild möjlighet: du kan använda namnen på metadatafält. Till exempel anger (?P<title>) att calibre ska använda denna del av strängen som boktitel. De tillåtna fältnamnen visas i fönstret tillsammans med ett praktiskt testfält. Anta att du vill importera många filer med namn som Classical Texts: The Divine Comedy by Dante Alighieri.mobi (som förstås redan finns i ditt bibliotek, eftersom vi alla älskar klassisk italiensk poesi) eller Science Fiction epics: The Foundation Trilogy by Isaac Asimov.epub. calibre kan inte extrahera meningsfulla metadata ur dessa namn med standarduttrycket (?P<title>.+) - (?P<author>[^_]+). Ett reguljärt uttryck som fungerar här är [a-zA-Z]+: (?P<title>.+) by (?P<author>.+). Observera att du måste använda uttryck inuti gruppen för metadatafältet för att beskriva vad fältet ska matcha. När du använder calibres testfält måste du även ta med filändelsen i testfilnamnet. Annars får du inga matchningar, även om uttrycket fungerar.
Redigera metadata i grupp¶
Den sista användningen är Sök och ersätt med reguljära uttryck i metadatafält. Du når funktionen genom att markera flera böcker i biblioteket och välja massredigering av metadata. Var mycket försiktig när du använder denna funktion, eftersom den kan göra mycket stor skada i biblioteket! Kontrollera med hjälp av testfälten att uttrycken gör precis det du avser, och markera endast de böcker som verkligen ska ändras. I sökläget för reguljära uttryck kan du söka i ett fält, ersätta texten och till och med skriva resultatet till ett annat fält. Ett praktiskt exempel: Anta att biblioteket innehåller böckerna i Frank Herberts Dune-serie med titlar som Dune 1 - Dune, Dune 2 - Dune Messiah och så vidare. Du vill nu lägga in Dune i seriefältet. Sök då efter (.*?) \d+ - .* i titelfältet och ersätt med \1 i seriefältet. Ser du vad som händer? \1 är en referens till den första gruppen, vars innehåll skrivs till seriefältet. När serien är korrekt behöver du bara söka efter .*? - i titelfältet och ersätta det med "" (en tom sträng), återigen i titelfältet. Därefter är dina metadata prydliga och konsekventa. Visst är det praktiskt? I stället för att ersätta hela fältet kan du även lägga till text i början eller slutet. Om du exempelvis vill lägga serieinformationen före boktiteln kan du göra det. Som du säkert redan har sett finns även kryssrutan Skiftlägeskänslig, så du behöver inte använda flaggor för att styra detta beteende.
Därmed är den här mycket korta introduktionen till reguljära uttryck nästan slut. Förhoppningsvis har du fått tillräckligt med kunskap för att komma igång och fortsätta lära dig på egen hand. En bra utgångspunkt är Python-dokumentationen om reguljära uttryck.
Ett sista varningens ord: Reguljära uttryck är kraftfulla, men det är också mycket lätt att göra fel. calibre har utmärkta testfunktioner som visar om uttrycken fungerar som du förväntar dig. Använd dem. Försök att inte skjuta dig själv i foten. (Jag älskar verkligen det uttrycket.) Om du trots varningen ändå skadar foten, eller någon annan kroppsdel, försök att lära dig av misstaget.
Snabbreferens¶
Medverkande¶
Tack för hjälpen med tips, rättningar och sådant:
ldolse
kovidgoyal
chaley
dwanthny
kacir
Starson17
Orpheu
Mer information om reguljära uttryck finns i Python-dokumentationen. Det bibliotek för reguljära uttryck som faktiskt används av calibre är regex, som har flera användbara förbättringar jämfört med Pythons standardbibliotek.
