Small fix to title handling code to deal with unicode better

[rss2maildir.git] / rss2maildir.py
diff --git a/rss2maildir.py b/rss2maildir.py

index b0bc441d09b23c56807d993ff98c9f9c09372dde..563da506da2d8f95307e44c38e6e0392882d3793 100755 (executable)
--- a/rss2maildir.py
+++ b/rss2maildir.py
@@ -44,18 +44,134 @@ import md5
  import cgi
  import dbm
  
+import re
+
  from HTMLParser import HTMLParser
  
  class HTML2Text(HTMLParser):
      entities = {
-        u'amp': "&",
-        u'lt': "<",
-        u'gt': ">",
-        u'pound': "£",
-        u'copy': "©",
-        u'apos': "'",
-        u'quot': "\"",
-        u'nbsp': " ",
+        u'amp': u'&',
+        u'lt': u'<',
+        u'gt': u'>',
+        u'pound': u'£',
+        u'copy': u'©',
+        u'apos': u'\'',
+        u'quot': u'"',
+        u'nbsp': u' ',
+        u'ldquo': u'“',
+        u'rdquo': u'”',
+        u'lsquo': u'‘',
+        u'rsquo': u'’',
+        u'laquo': u'«',
+        u'raquo': u'»',
+        u'lsaquo': u'‹',
+        u'rsaquo': u'›',
+        u'bull': u'•',
+        u'middot': u'·',
+        u'deg': u'°',
+        u'helip': u'…',
+        u'trade': u'™',
+        u'reg': u'®',
+        u'agrave': u'à',
+        u'Agrave': u'À',
+        u'egrave': u'è',
+        u'Egrave': u'È',
+        u'igrave': u'ì',
+        u'Igrave': u'Ì',
+        u'ograve': u'ò',
+        u'Ograve': u'Ò',
+        u'ugrave': u'ù',
+        u'Ugrave': u'Ù',
+        u'aacute': u'á',
+        u'Aacute': u'Á',
+        u'eacute': u'é',
+        u'Eacute': u'É',
+        u'iacute': u'í',
+        u'Iacute': u'Í',
+        u'oacute': u'ó',
+        u'Oacute': u'Ó',
+        u'uacute': u'ú',
+        u'Uacute': u'Ú',
+        u'yactue': u'ý',
+        u'Yacute': u'Ý',
+        u'acirc': u'â',
+        u'Acirc': u'Â',
+        u'ecirc': u'ê',
+        u'Ecirc': u'Ê',
+        u'icirc': u'î',
+        u'Icirc': u'Î',
+        u'ocirc': u'ô',
+        u'Ocirc': u'Ô',
+        u'ucirc': u'û',
+        u'Ucirc': u'Û',
+        u'atilde': u'ã',
+        u'Atilde': u'Ã',
+        u'ntilde': u'ñ',
+        u'Ntilde': u'Ñ',
+        u'otilde': u'õ',
+        u'Otilde': u'Õ',
+        u'auml': u'ä',
+        u'Auml': u'Ä',
+        u'euml': u'ë',
+        u'Euml': u'Ë',
+        u'iuml': u'ï',
+        u'Iuml': u'Ï',
+        u'ouml': u'ö',
+        u'Ouml': u'Ö',
+        u'uuml': u'ü',
+        u'Uuml': u'Ü',
+        u'yuml': u'ÿ',
+        u'Yuml': u'Ÿ',
+        u'iexcl': u'¡',
+        u'iquest': u'¿',
+        u'ccedil': u'ç',
+        u'Ccedil': u'Ç',
+        u'oelig': u'œ',
+        u'OElig': u'Œ',
+        u'szlig': u'ß',
+        u'oslash': u'ø',
+        u'Oslash': u'Ø',
+        u'aring': u'å',
+        u'Aring': u'Å',
+        u'aelig': u'æ',
+        u'AElig': u'Æ',
+        u'thorn': u'þ',
+        u'THORN': u'Þ',
+        u'eth': u'ð',
+        u'ETH': u'Ð',
+        u'mdash': u'—',
+        u'ndash': u'–',
+        u'sect': u'§',
+        u'para': u'¶',
+        u'uarr': u'↑',
+        u'darr': u'↓',
+        u'larr': u'←',
+        u'rarr': u'→',
+        u'dagger': u'†',
+        u'Dagger': u'‡',
+        u'permil': u'‰',
+        u'prod': u'∏',
+        u'infin': u'∞',
+        u'radic': u'√',
+        u'there4': u'∴',
+        u'int': u'∫',
+        u'asymp': u'≈',
+        u'ne': u'≠',
+        u'equiv': '≡',
+        u'le': u'≤',
+        u'ge': u'≥',
+        u'loz': u'⋄',
+        u'sum': u'∑',
+        u'part': u'∂',
+        u'prime': u'′',
+        u'Prime': u'″',
+        u'harr': u'↔',
+        u'micro': u'µ',
+        u'not': u'¬',
+        u'plusmn': u'±',
+        u'divide': u'÷',
+        u'cent': u'¢',
+        u'euro': u'€',
          }
  
      blockleveltags = [
@@ -74,7 +190,7 @@ class HTML2Text(HTMLParser):
          u'dt',
          u'dd',
          u'div',
-        #u'blockquote',
+        u'blockquote',
          ]
  
      liststarttags = [
@@ -116,6 +232,9 @@ class HTML2Text(HTMLParser):
                  self.listcount.append(1)
                  self.listlevel = len(self.listcount) - 1
  
+            if tag_name == u'dl':
+                self.indentlevel = self.indentlevel + 4
+
              if tag_name in self.liststarttags:
                  smallist = self.opentags[-3:-1]
                  smallist.reverse()
@@ -196,12 +315,11 @@ class HTML2Text(HTMLParser):
                      else:
                          while self.images.has_key(alt):
                              alt = alt + "_"
-                        self.images[alt]["url"] = url
+                        self.images[alt] = {"url": url}
                          self.curdata = self.curdata \
                              + u'|%s|' %(alt,)
                  else:
-                    self.images[alt] = {}
-                    self.images[alt]["url"] = url
+                    self.images[alt] = {"url": url}
                      self.curdata = self.curdata \
                          + u'|%s|' %(alt,)
              else:
@@ -286,16 +404,16 @@ class HTML2Text(HTMLParser):
                          paragraph, self.textwidth - self.indentlevel))
          elif tag_thats_done == "pre":
              self.text = self.text + unicode( \
-                " ".join(self.curdata.encode("utf-8").split()), "utf-8")
+                self.curdata.encode("utf-8"), "utf-8")
          elif tag_thats_done == u'blockquote':
              quote = unicode( \
                  " ".join(self.curdata.encode("utf-8").strip().split()), \
                  "utf-8")
-            seperator = u'\n' + u' ' * self.indentlevel + u'> '
+            seperator = u'\n' + u' ' * self.indentlevel + u'    '
              if len(self.text) > 0 and self.text[-1] != u'\n':
                  self.text = self.text + u'\n'
              self.text = self.text \
-                + u'> ' \
+                + u'    ' \
                  + seperator.join( \
                      textwrap.wrap( \
                          quote, \
@@ -349,12 +467,12 @@ class HTML2Text(HTMLParser):
                  self.text = self.text + u'\n\n'
              elif len(self.text) > 1 and self.text[-2] != u'\n':
                  self.text = self.text + u'\n'
-            definition = u' ' * self.indentlevel + definition + "::"
-            indentstring = u'\n' + u' ' * (self.indentlevel + 1)
+            definition = u' ' * (self.indentlevel - 4) + definition + "::"
+            indentstring = u'\n' + u' ' * (self.indentlevel - 3)
              self.text = self.text \
                  + indentstring.join(
                      textwrap.wrap(definition, \
-                        self.textwidth - self.indentlevel - 1))
+                        self.textwidth - self.indentlevel - 4))
              self.curdata = u''
          elif tag_thats_done == u'dd':
              definition = unicode(" ".join( \
@@ -363,13 +481,13 @@ class HTML2Text(HTMLParser):
              if len(definition) > 0:
                  if len(self.text) > 0 and self.text[-1] != u'\n':
                      self.text = self.text + u'\n'
-                indentstring = u'\n' + u' ' * (self.indentlevel + 4)
+                indentstring = u'\n' + u' ' * self.indentlevel
                  self.text = self.text \
-                    + u' ' * (self.indentlevel + 4) \
+                    + indentstring \
                      + indentstring.join( \
                          textwrap.wrap( \
                              definition, \
-                            self.textwidth - self.indentlevel - 4 \
+                            self.textwidth - self.indentlevel \
                              ) \
                          )
                  self.curdata = u''
@@ -398,8 +516,11 @@ class HTML2Text(HTMLParser):
          if tag in [u'br', u'img']:
              return
  
+        if tag == u'dl':
+            self.indentlevel = self.indentlevel - 4
+
          if tag in self.liststarttags:
-            if tag in [u'ol', u'dl', u'ul']:
+            if tag in [u'ol', u'dl', u'ul', u'dd']:
                  self.handle_curdata()
                  # find if there was a previous list level
                  smalllist = self.opentags[:-1]
@@ -437,16 +558,29 @@ class HTML2Text(HTMLParser):
              self.opentags.append(u'p')
          self.curdata = self.curdata + data.decode("utf-8")
  
+    def handle_charref(self, name):
+        try:
+            entity = unichr(int(name))
+        except:
+            if name[0] == 'x':
+                try:
+                    entity = unichr(int('0%s' %(name,), 16))
+                except:
+                    entity = u'#%s' %(name,)
+            else:
+                entity = u'#%s' %(name,)
+        self.curdata = self.curdata + unicode(entity.encode('utf-8'), \
+            "utf-8")
+
      def handle_entityref(self, name):
          entity = name
-        if HTML2Text.entities.has_key(name.lower()):
-            entity = HTML2Text.entities[name.lower()]
-        elif name[0] == "#":
-            entity = unichr(int(name[1:]))
+        if HTML2Text.entities.has_key(name):
+            entity = HTML2Text.entities[name]
          else:
              entity = "&" + name + ";"
  
-        self.curdata = self.curdata + unicode(entity, "utf-8")
+        self.curdata = self.curdata + unicode(entity.encode('utf-8'), \
+            "utf-8")
  
      def gettext(self):
          self.handle_curdata()
@@ -462,7 +596,7 @@ class HTML2Text(HTMLParser):
              self.urls = []
          if len(self.images.keys()) > 0:
              self.text = self.text + u'\n.. ' \
-                + u'.. '.join( \
+                + u'\n.. '.join( \
                      ["|%s| image:: %s" %(a, self.images[a]["url"]) \
                  for a in self.images.keys()]) + u'\n'
              self.images = {}
@@ -549,7 +683,10 @@ def parse_and_deliver(maildir, url, statedir):
          if item.has_key("content"):
              content = item["content"][0]["value"]
          else:
-            content = item["summary"]
+            if item.has_key("description"):
+                content = item["description"]
+            else:
+                content = u''
  
          md5sum = md5.md5(content.encode("utf-8")).hexdigest()
  
@@ -601,7 +738,12 @@ def parse_and_deliver(maildir, url, statedir):
          except:
              pass
          msg.add_header("Date", createddate)
-        msg.add_header("Subject", item["title"])
+        subj_gen = HTML2Text()
+        title = item["title"]
+        title = re.sub(u'<', u'&lt;', title)
+        title = re.sub(u'>', u'&gt;', title)
+        subj_gen.feed(title.encode("utf-8"))
+        msg.add_header("Subject", subj_gen.gettext())
          msg.set_default_type("text/plain")
  
          htmlcontent = content.encode("utf-8")