Constituídos os textos eletrônicos de suporte, as ocorrências e seus respectivos contextos foram copiados e transpostos (copy / paste) para planilhas do MicroSoft Excel nomeadas a partir do texto-fonte (Fig. PN.4). Os principais delimitadores utilizados para a definição do comprimento do contexto foram a) a inclusão dos elementos S, V e C expressos, b) a largura da coluna e c) qualquer elemento de pontuação. Estruturas intercaladas separando os constituintes S/V/C, como aposto ou orações subordinadas, foram substituídas por reticências e, sempre que necessário, passaram a constituir entrada separada na tabela6. Em seguida, utilizaram-se os critérios expostos adiante, nesta mesma
Seção, para marcar as ocorrências segundo as características com que se apresentam; o resultado é uma tabela semelhante à da Fig. PN.5b, onde de encontram a ocorrência em seu contexto e os traços atribuídos à mesma. Esse procedimento foi utilizado em Totaro 1998 e em Lima 2003, e acompanha muitas das sugestões feitas por Leech et al. 1996 e Biber, Conrad & Reppen 1998 sobre a marcação sintática de corpora.
A coleta de ocorrências foi feita em textos espanhóis dos séculos XIII a XX (os mesmos textos utilizados para a constituição do corpus em Totaro 1998), portugueses dos séculos XV a XX (dois da Biblioteca da FaLe / os demais, a partir dos textos disponíveis na Biblioteca Nacional Digital - www.bnd.pt) e italianos dos séculos XV a XX (todos obtidos na coleção eletrônica Gallica da BNF – gallica.bnf.fr); consultaram-se as gramáticas históricas disponíveis em formato digital e na FaLe (v. referências bibliográficas abaixo) a fim de que se identificassem as estruturas sintáticas com a maior pertinência possível, considerando-se com mais cuidado, por certo, a classificação de casos menos prototípicos. Na seleção dos textos, utilizaram-se os mesmos critérios que orientaram em Totaro 1998 a busca de fontes filologicamente adequadas para a amostragem de sintagmas nominais.
Os excertos das obras que se prestaram à prospecção de ocorrências foram a) digitalizados com o auxílio de scanner e convertidos em formato .TXT através da utilização de um sistema OCR da HP, nos casos em que as bibliotecas visitadas dispunham de exemplares para consulta, ou b) descarregadas diretamente das bibliotecas eletrônicas em formato .PDF ou .JPG através de protocolos servidor-cliente e tratadas manualmente. Em
6
Esse procedimento é semelhante ao modelo híbrido constituência-dependência discutido por Teich 1998 para a identificação de sintagmas.
ambos os casos e especialmente com respeito às obras em que há grande número de abreviaturas, procedeu-se ao desdobramento manual das mesmas (cf. preceitos de Capelli 2001). Dessa maneira, a base de dados foi composta em formato .XLS, destacando-se as ocorrências oracionais do texto eletrônico e classificando-as segundo seus caracteres de estruturas subordinadas e/ou coordenadas. Para fazer essa classificação, utilizaram-se os princípios de tendência funcional para a avaliação da relação entre orações, como exposto em Pidal (1949) para a sintaxe histórica do espanhol, tendo-se estendido o mesmo procedimento ao português e ao italiano.
201
disperazione, tutti insieme... Oppure no, non è una buona analogia. Pensa a un fiume, denso e maestoso, che corre per miglia e miglia entro argini robusti, e tu sai dove sia il fiu- me, dove l'argine, dove la terra ferma. A un certo punto il fiume, per stanchezza, perché ha corso per troppo tempo e troppo spazio, perché si avvicina il mare, che annulla in sé tutti i fiumi, non sa più cosa sia. Diventa il proprio delta. Rimane forse un ramo maggiore, ma molti se ne diramano, in ogni direzione, e alcuni riconfluiscono gli uni negli altri, e non sai più cosa sia origine di cosa, e talora non sai cosa sia fiume ancora, e cosa già mare..."
"Se capisco la vostra allegoria, il fiume è la città di Dio, o il regno dei giusti, che si sta avvicinando al millennio, e in questa incertezza esso non tiene più, nascono falsi e veri profeti e tutto confluisce nella gran piana dove avrà luogo l'Armageddon..."
"Non pensavo proprio a questo. Ma è anche vero che tra noi francescani è sempre viva l'idea di una terza età e del- l'avvento del regno dello Spirito Santo. No, piuttosto cerca- vo di farti capire come il corpo della chiesa, che è stato per secoli anche il corpo della società tutta, il popolo di Dio, è diventato troppo ricco, e denso, e trascina con sé le scorie di tutti i paesi che ha attraversato, e ha perso la propria purez-za. I rami del delta sono, se vuoi, altrettanti tentativi del fiume di correre il più presto possibile al mare, ovvero al momento della purificazione.
.
.
.
AN / NA
Oppure no, non è una buona analogia. Pensa a un fiume, denso che corre per miglia e miglia entro argini robusti, e tu sai sai dove sia il fiume, dove l'argine, dove la terra ferma. A un certo il proprio delta. Rimane forse un ramo maggiore, ma molti se ne
.
.
.
S-V-C
e alcuni riconfluiscono gli uni negli altri, e non sai più cosa sia origine di cosa, e talora e alcuni riconfluiscono gli uni negli altri, e non sai più cosa sia origine di cosa, e talora e alcuni riconfluiscono gli uni negli altri, e non sai più cosa sia origine di cosa, e talora e talora non sai cosa sia fiume ancora, e cosa già mare..."
"Se capisco la vostra allegoria, il fiume è la città di Dio, o il regno dei giusti, che "Se capisco la vostra allegoria, il fiume è la città di Dio, o il regno dei giusti, che
.
.
.
Fig. PN.4 – Ilustração do procedimento de constituição das bases de dados .XLS de AN (italiano) e de S-V-C (para os três sistemas) a partir dos arquivos .DOC gerados no passo anterior pelo OCR.