O ortho sempre verifica se as palavras estão corretamente acentuadas. Infelizmente há muitas convenções em uso para indicar acentos. As convenções reconhecidas pelo ortho são:
Exemplo: "s\363 n\343o t\352m gra\347a ..."
A codificação ISO Latin-1 é uma extensão do código ASCII, de 7 para 8 bits, definida pela International Standards Association. Esta codificação é o padrão usado pela maioria dos editores e processadres de texto modernos e pela rede WWW.
Na codificação ISO Latin-1, as letras acentuadas do Português (e muitos outros símbolos) são representadas por bytes na faixa octal \200..\377 (decimal 128..255, hexadecimal 80..FF).
Especificamente, as letras acentuadas do português têm estes códigos:
octal hexa octal hexa
á = 341 E1 Á = 301 C1
é = 351 E9 É = 311 C9
í = 355 ED Í = 315 CD
ó = 363 F3 Ó = 323 D3
ú = 372 FA Ú = 332 DA
â = 342 E2 Â = 302 C2
ê = 352 EA Ê = 312 CA
ô = 364 F4 Ô = 324 D4
ã = 343 E3 Ã = 303 C3
õ = 365 F5 Õ = 325 D5
à = 340 E0 À = 300 C0
ü = 374 FC Ü = 334 DC
Ç = 307 C7 ç = 347 E7
Exemplo: "s'o n~ao t^em gra,ca ..."
Esta convenção imita as máquinas de escrever para português, onde se bate a tecla do acento antes da letra a acentuar. As combinações reconhecidas são
á = 'a Á = 'A
é = 'e É = 'E
í = 'i Í = 'I
ó = 'o Ó = 'O
ú = 'u Ú = 'U
ü = "u Ü = "U
â = ^a  = ^A
ê = ^e Ê = ^E
ô = ^o Ô = ^O
ã = ~a à = ~A
õ = ~o Õ = ~O
à = `a À = `A
ç = 'c OU ,c Ç = 'C OU ,C
Exemplo: "s\'o n\~ao t\^em gra\c{c}a ..."
Esta é a codificação de acentos usada pelos formatadores de texto TeX (de Donald Knuth) e LaTeX (de Leslie Lamport). As seqüências reconhecidas são
á = \'a OU \'{a} Á = \'A OU \'{A}
é = \'e OU \'{e} É = \'E OU \'{E}
í = \'\i OU \'{\i} Í = \'\I OU \'{\I}
ó = \'o OU \'{o} Ó = \'O OU \'{O}
ú = \'u OU \'{u} Ú = \'U OU \'{U}
ã = \~a OU \~{a} Ã = \~A OU \~{A}
õ = \~o OU \~{o} Õ = \~O OU \~{O}
â = \^a OU \^{a} Â = \^A OU \^{A}
ê = \^e OU \^{e} Ê = \^E OU \^{E}
ô = \^o OU \^{o} Ô = \^O OU \^{O}
ü = \"u OU \"{u} Ü = \"U OU \"{U}
à = \`a OU \`{a} À = \`A OU \`{A}
ç = \c c OU \c{c} Ç = \c C OU \c{C}
Exemplo: "s\227 n\213o t\220m gra\215a"
Os computadores da linha Macintosh da Apple utilizam uma codificação própria para letras acentuadas. Trata-se de uma extensão de 8 bits da codificação ASCII, como a ISO Latin-1, mas os códigos das letras acentuadas são diferentes. Os códigos Macintosh reconhecidos pelo ortho são:
á = 207 87 Á = 347 E7
é = 216 8E É = 203 83
í = 222 92 Í = 352 EA
ó = 227 97 Ó = 356 EE
ú = 234 9C Ú = 362 F2
â = 211 89 Â = 345 E5
ê = 220 90 Ê = 346 E6
ô = 231 99 Ô = 357 EF
ã = 213 8B Ã = 314 CC
õ = 233 9B Õ = 315 CD
à = 210 88 À = 313 CB
ü = 237 9F Ü = 206 86
ç = 202 82 Ç = 215 8D
Ao processar arquivos neste formato, o ortho também procura remover as macros do TeX/LaTeX (\it, \dots, \begin, etc.) e fórmulas matemáticas, usando o filtro delatex.
Exemplo: "só não têm graça ..."
HTML é o formato padrão das "páginas" distribuídas pelo Word Wide Web (WWW). Num arquivo HTML, letras acentuadas são normalmente representadas por bytes de 8 bits, segundo a codificação ISO Latin 1. Por definição, todos os browsers WWW conseguem exibir tais caracteres.
Entretanto, há muitos editores de texto atualmente em uso que ainda não permitem digitar acentos nessa codificação. Em vista disso, o padrão HTML inclui também uma representação alternativa para letras acentuadas e outros símbolos não-ASCII. Essa representação consiste no símbolo "&" seguido do nome do caracter acentuado, terminado com ";". Os acentos portugueses são:
á = á Á = Á
é = é É = É
í = í Í = Í
ó = ó Ó = Ó
ú = ú Ú = Ú
â = â Â = Â
ê = ê Ê = Ê
ô = ô Ô = Ô
ã = ã Ã = Ã
õ = õ Õ = Õ
à = à À = À
ü = ü Ü = Ü
ç = ç Ç = Ç
Ao processar arquivos neste formato, o ortho também elimina os demais códigos de formatação do HTML (<title>, <em>, <hr>, <a href=...>, <table>, etc.).