Verificador e Conselheiro Ortográfico ortho

Codificação de acentos

O ortho sempre verifica se as palavras estão corretamente acentuadas. Infelizmente há muitas convenções em uso para indicar acentos. As convenções reconhecidas pelo ortho são:

ISO Latin 1 (ISO 8859-1)

Exemplo: "s\363 n\343o t\352m gra\347a ..."

A codificação ISO Latin-1 é uma extensão do código ASCII, de 7 para 8 bits, definida pela International Standards Association. Esta codificação é o padrão usado pela maioria dos editores e processadres de texto modernos e pela rede WWW.

Na codificação ISO Latin-1, as letras acentuadas do Português (e muitos outros símbolos) são representadas por bytes na faixa octal \200..\377 (decimal 128..255, hexadecimal 80..FF).

Especificamente, as letras acentuadas do português têm estes códigos:

              octal hexa                octal hexa
                                                    
         á  =  341   E1            Á  =  301   C1 
         é  =  351   E9            É  =  311   C9 
         í  =  355   ED            Í  =  315   CD 
         ó  =  363   F3            Ó  =  323   D3 
         ú  =  372   FA            Ú  =  332   DA 
                                                  
         â  =  342   E2            Â  =  302   C2 
         ê  =  352   EA            Ê  =  312   CA 
         ô  =  364   F4            Ô  =  324   D4 
                                                  
         ã  =  343   E3            Ã  =  303   C3 
         õ  =  365   F5            Õ  =  325   D5 
                                                  
         à  =  340   E0            À  =  300   C0 
                                                  
         ü  =  374   FC            Ü  =  334   DC 
                                              
         Ç  =  307   C7            ç  =  347   E7

ASCII acento+letra

Exemplo: "s'o n~ao t^em gra,ca ..."

Esta convenção imita as máquinas de escrever para português, onde se bate a tecla do acento antes da letra a acentuar. As combinações reconhecidas são

    
         á  =  'a                  Á  =  'A              
         é  =  'e                  É  =  'E              
         í  =  'i                  Í  =  'I              
         ó  =  'o                  Ó  =  'O              
         ú  =  'u                  Ú  =  'U              
                                                         
         ü  =  "u                  Ü  =  "U              
                                                         
         â  =  ^a                  Â  =  ^A              
         ê  =  ^e                  Ê  =  ^E              
         ô  =  ^o                  Ô  =  ^O              
                                                         
         ã  =  ~a                  Ã  =  ~A              
         õ  =  ~o                  Õ  =  ~O              
                                                         
         à  =  `a                  À  =  `A              
                                                         
         ç  =  'c  OU  ,c          Ç  =  'C  OU  ,C      
      

TeX/LaTeX

Exemplo: "s\'o n\~ao t\^em gra\c{c}a ..."

Esta é a codificação de acentos usada pelos formatadores de texto TeX (de Donald Knuth) e LaTeX (de Leslie Lamport). As seqüências reconhecidas são

    
         á  =  \'a  OU  \'{a}      Á  =  \'A  OU  \'{A}      
         é  =  \'e  OU  \'{e}      É  =  \'E  OU  \'{E}      
         í  =  \'\i OU  \'{\i}     Í  =  \'\I OU  \'{\I}     
         ó  =  \'o  OU  \'{o}      Ó  =  \'O  OU  \'{O}      
         ú  =  \'u  OU  \'{u}      Ú  =  \'U  OU  \'{U}      
                                                             
         ã  =  \~a  OU  \~{a}      Ã  =  \~A  OU  \~{A}      
         õ  =  \~o  OU  \~{o}      Õ  =  \~O  OU  \~{O}      
                                                             
         â  =  \^a  OU  \^{a}      Â  =  \^A  OU  \^{A}      
         ê  =  \^e  OU  \^{e}      Ê  =  \^E  OU  \^{E}      
         ô  =  \^o  OU  \^{o}      Ô  =  \^O  OU  \^{O}      
                                                             
         ü  =  \"u  OU  \"{u}      Ü  =  \"U  OU  \"{U}      
                                                             
         à  =  \`a  OU  \`{a}      À  =  \`A  OU  \`{A}      
                                                             
         ç  =  \c c  OU  \c{c}     Ç  =  \c C  OU  \c{C}     

Macintosh

Exemplo: "s\227 n\213o t\220m gra\215a"

Os computadores da linha Macintosh da Apple utilizam uma codificação própria para letras acentuadas. Trata-se de uma extensão de 8 bits da codificação ASCII, como a ISO Latin-1, mas os códigos das letras acentuadas são diferentes. Os códigos Macintosh reconhecidos pelo ortho são:


         á  =  207   87            Á  =  347   E7 
         é  =  216   8E            É  =  203   83 
         í  =  222   92            Í  =  352   EA 
         ó  =  227   97            Ó  =  356   EE 
         ú  =  234   9C            Ú  =  362   F2 
                                                  
         â  =  211   89            Â  =  345   E5 
         ê  =  220   90            Ê  =  346   E6 
         ô  =  231   99            Ô  =  357   EF 
                                                  
         ã  =  213   8B            Ã  =  314   CC 
         õ  =  233   9B            Õ  =  315   CD 
                                                  
         à  =  210   88            À  =  313   CB 
                                                  
         ü  =  237   9F            Ü  =  206   86 
                                              
         ç  =  202   82            Ç  =  215   8D

Ao processar arquivos neste formato, o ortho também procura remover as macros do TeX/LaTeX (\it, \dots, \begin, etc.) e fórmulas matemáticas, usando o filtro delatex.

HTML

Exemplo: "só não têm graça ..."

HTML é o formato padrão das "páginas" distribuídas pelo Word Wide Web (WWW). Num arquivo HTML, letras acentuadas são normalmente representadas por bytes de 8 bits, segundo a codificação ISO Latin 1. Por definição, todos os browsers WWW conseguem exibir tais caracteres.

Entretanto, há muitos editores de texto atualmente em uso que ainda não permitem digitar acentos nessa codificação. Em vista disso, o padrão HTML inclui também uma representação alternativa para letras acentuadas e outros símbolos não-ASCII. Essa representação consiste no símbolo "&" seguido do nome do caracter acentuado, terminado com ";". Os acentos portugueses são:


         á  =  á            Á  =  Á
         é  =  é            É  =  É
         í  =  í            Í  =  Í
         ó  =  ó            Ó  =  Ó
         ú  =  ú            Ú  =  Ú
                                                         
         â  =  â             Â  =  Â 
         ê  =  ê             Ê  =  Ê 
         ô  =  ô             Ô  =  Ô 
                                                         
         ã  =  ã            Ã  =  Ã
         õ  =  õ            Õ  =  Õ
                                                         
         à  =  à            À  =  À
                
         ü  =  ü              Ü  =  Ü
                
         ç  =  ç            Ç  =  Ç

Ao processar arquivos neste formato, o ortho também elimina os demais códigos de formatação do HTML (<title>, <em>, <hr>, <a href=...>, <table>, etc.).


last edited 97-10-03 by stolfi