Escolar Documentos
Profissional Documentos
Cultura Documentos
Ararangu, 2012
Thales do Nascimento da Silva
_______________________________
Alexandre Leopoldo Gonalves, Dr.
Universidade Federal de Santa Catarina
_______________________________
Anderson Luiz Fernandes Perez, Dr.
Universidade Federal de Santa Catarina
_______________________________
Luciana Bolan Frigo, Dra.
Universidade Federal de Santa Catarina
Currently the amount of information increases exponentially in which a great portion of these
information is in textual format. From this format is possible to extract knowledge. However,
considering the huge volume of information available, either the web or even in organizations,
this task can be seen as a computational challenge. The knowledge acquired through textual
information, once overcome the obstacles, can be used in decision making process aiming to
generate competitive advantage. This can be done through Knowledge Discovery in Text. In
general, traditional knowledge discovery processes are expensive when applied to large
corpus, for instance, the web. Taken it into account is proposed in this work an architecture
for knowledge discovery from textual databases aiming its use in large sources of information.
Aiming to achieve the main objective this work focus on distributed computing in order to
increase performance and on a fast correlation based model. The feasibility is demonstrated
through a prototype implemented using the proposed architecture. The prototype has proved
the ability to extract information by linking textual patterns (terms) and by allowing a
temporal view in a given domain. The application of the prototype in a scenario has
demonstrated that the proposed architecture is able to obtain consistent and satisfactory
results.
DW Data Warehouse
IP Internet Protocol
MD Minerao de Dados
MT Minerao de Textos
1. INTRODUO .................................................................................................... 15
1.1 PROBLEMA ...................................................................................................... 17
1.2 OBJETIVOS ...................................................................................................... 18
1.2.1 Objetivo Geral ................................................................................................ 18
1.2.2 Objetivos Especficos ..................................................................................... 18
1.3 METODOLOGIA ............................................................................................... 19
1.4 ORGANIZAO DO TEXTO ............................................................................ 20
2. PROCESSOS DE descoberta de conhecimento ............................................. 21
2.1 DESCOBERTA DE CONHECIMENTO ............................................................. 21
2.1.1 MODELOS BASEADOS EM COOCORRNCIA ........................................... 26
2.1.1.1 Frequncia ................................................................................................. 27
2.1.1.2 Mdia e Varincia ...................................................................................... 27
2.1.1.3 Teste de hiptese ...................................................................................... 28
2.1.1.4 Teste de Pearson - Chi-square () ......................................................... 28
2.1.1.5 Phi-squared() ........................................................................................ 29
2.1.1.6 Informao Mtua ..................................................................................... 29
2.1.2 ASSOCIAO DE ELEMENTOS TEXTUAIS ................................................ 29
2.1.2.1 Descoberta ABC ........................................................................................ 32
2.1.3 MODELO VETORIAL ..................................................................................... 34
3. COMPUTAO DISTRIBUDA........................................................................... 37
3.1 SISTEMAS COM MULTIPLOS PROCESSADORES ........................................ 37
3.2 COMPUTAO DISTRIBUDA DE ALTO DESEMPENHO ............................... 39
3.2.1 CLUSTER ...................................................................................................... 41
3.2.2 GRID .............................................................................................................. 42
3.2.2.1 GridGain..................................................................................................... 43
4. MODELO PROPOSTO ....................................................................................... 45
4.1 MODELO LGICO ........................................................................................... 45
4.2 MODELO FSICO ............................................................................................. 50
4.2.1 SERVIO DE CONSULTA ............................................................................. 50
4.2.2 MODELO DIMENSIONAL .............................................................................. 52
4.2.3 SERVIO DE CORRELAO ....................................................................... 55
5. APRESENTAO DOS RESULTADOS ............................................................. 58
5.1 INTRODUO .................................................................................................. 58
5.2 CENRIO DE APLICAO .............................................................................. 59
5.3 ANLISE DE PERFIL ....................................................................................... 62
5.3.1 Frequncia Individual ..................................................................................... 63
5.3.2 Frequncia Conjunta ...................................................................................... 64
5.3.3 Correlao entre termos ................................................................................ 64
5.3.4 Correlao entre termos (temporal) ............................................................... 65
5.3.5 Anlise dos Resultados Obtidos .................................................................... 66
5.4 MAPA DE TPICOS ......................................................................................... 69
6. CONSIDERAES FINAIS ................................................................................ 72
15
1. INTRODUO
Em 2003 o mundo produzia entre um e dois exabytes de informao nova por ano, ou
seja, algo em torno de 250 megabytes para cada habitante na Terra (LYMAN; VARIAN,
2003). Um exabyte equivale a pouco mais de um bilho de gigabytes. Estima-se que
documentos impressos, que eram o meio mais comum de informao textual h algumas
dcadas, hoje representem apenas 0,003% da informao gerada anualmente (LYMAN;
VARIAN, 2003).
Autores como Wilson (2002) e Alavi et al. (2001) afirmam que o conhecimento
envolve processos mentais, entendimento e aprendizagem, e como tal, reside somente na
mente das pessoas. Afirmam ainda que tudo aquilo que se utilize para expressar algo
realizado por meio de mensagens, desse modo, no constitui conhecimento e sim informao.
Entretanto, outros autores consideram que o conhecimento pode ser explicitado (NONAKA;
TAKEUCHI, 1995; SCHREIBER et al., 2002). Para Gonalves (2006), no o conhecimento
em si, mas redes de relacionamento, regras, padres, tendncias, entre outros, podem ser
explicitados e se constituem, portanto, em ativos de conhecimento. Esses ativos podem ento,
atravs de ferramental adequado, serem descobertos visando auxiliar em processos de tomada
de deciso.
1.1 PROBLEMA
Desse modo tem-se como pergunta de pesquisa Como elaborar uma arquitetura
voltada descoberta de conhecimento que, em conjunto com a computao distribuda, torne
vivel o estabelecimento de relaes temporais entre padres textuais a partir de grandes
fontes de informaes?.
1.2 OBJETIVOS
Modelar uma base de dados que suporte os dados gerados a partir do processo de
descoberta de conhecimento e permita representar a caracterstica temporal das
bases textuais.
1.3 METODOLOGIA
A informao pode ser encontrada em trs estados: estruturada, onde cada campo
possui a identificao da informao (Banco de Dados, Planilha de Textos); semiestruturada,
possui tags que possibilitam a marcao das informaes (XML, RDF); ou no estruturadas,
que so textos em linguagem natural. Apesar de um texto em linguagem natural ser
estruturado no sentido de possuir uma estrutura sinttica, a referncia a estrutura feita no
mbito da Cincia da Computao (BOVO, 2011). As informaes no estruturadas podem
ser encontradas em artigos, atas, sites, e-mails, ou seja, qualquer documento escrito em
linguagem natural. Uma organizao gera diversos documentos no estruturados, que contm
informaes importantes sobre a realidade da organizao, estes documentos muitas vezes so
ignorados, quando poderiam auxiliar no processo de tomada de deciso.
Como pode ser observado o KDD um processo iterativo no qual todas as fases so
importantes para se atingir o objetivo (SILVA, 2004). As fases tradicionais do processo de
KDD so:
Minerao de Dados: Segundo Fayyad et al., (1996) esta fase busca por padres
atravs de tarefas como: regras de classificao ou rvores, regresso, agrupamento, entre
outros. Essas anlises so geralmente executadas sobre uma grande quantidade de dados pr-
processados e armazenados por Data Warehouses/Data Marts (GONALVES, 2006).
O processo de KDD pode ser um grande aliado na busca por conhecimento, com o
objetivo de obter alguma vantagem competitiva nas organizaes. Porm, este processo no
24
comparaes vetoriais so otimizadas, uma vez que, considerando dois vetores quaisquer
basta realizar uma varredura no menor vetor para descobrir os termos semelhantes em relao
ao segundo vetor (vetor maior).
TERMOS t1 t2 t3 t4 t5 t6 t7
t1 - (t1,t2) (t1,t3) (t1,t4) (t1,t5) (t1,t6) (t1,t7)
t2 (t2,t1) - (t2,t3) (t2,t4) (t2,t4) (t2,t6) (t2,t7)
t3 (t3,t1) (t3,t2) - (t3,t4) (t3,t5) (t3,t6) (t3,t7)
t4 (t4,t1) (t4,t2) (t4,t3) - (t4,t5) (t4,t6) (t4,t7)
t5 (t5,t1) (t5,t2) (t5,t3) (t5,t4) - (t5,t6) (t5,t7)
t6 (t6,t1) (t6,t2) (t6,t3) (t6,t4) (t6,t5) - (t6,t7)
t7 (t7,t1) (t7,t2) (t7,t3) (t7,t4) (t7,t5) (t7,t6) -
Tabela 1 - Matriz de correlao TERMOxTERMO com 7 termos.
27
2.1.1.1 Frequncia
Uma maneira simples, ainda que imprecisa, de se estabelecer a relao entre dois
termos atravs da frequncia conjunta. Entretanto, considerar pares de termos frequentes
sem o devido tratamento no adequado. Isto porque em uma lngua, artigos e preposies,
por exemplo, aparecem constantemente ligados entre si ou com substantivos e verbos (ex:
para, a partir, abaixo so, entre outros, tecnologias da). Uma possvel soluo a utilizao de
uma lista de termos indesejveis (stop list) para retirar tais termos da anlise.
Este modelo permite encontrar relaes de maneira mais flexvel, pois considera a
relao de palavras mesmo havendo uma distncia distinta no texto (utiliza janelas). O clculo
deste modelo realizado da seguinte maneira: primeiramente calculada a mdia das
distncias em que as palavras ocorrem no texto com a seguinte equao, , sendo que,
s representa a soma das distncias, e n o nmero de coocorncias das palavras. Nesse sentido,
a varincia informa o grau de desvio das distncias a partir da mdia, sendo estimada
conforme a seguinte equao, , onde n o nmero de vezes que as
Tabela 2 - Tabela de contingncia de 2x2.
2.1.1.5 Phi-squared( )
, onde .
VETORES DE CONTEXTO
Web
RDF OWL SPARQL Ontologia Tesauro URI
Semntica
RDF - w 0.1 w 0 w w
OWL w - 0.2 w 0 w w
VETORES DE CONTEXTO
Web
0.1 0.2 - 0.1 0 0.4 0
Semntica
URI w w 0 w 0.1 w -
Tabela 3 - Vetores de Contexto.
O termo Web Semntica possui em seu vetor de contexto, outros termos que
coocorrem com o mesmo, ou seja, os termos do vetor (RDF, OWL, Tesauro, SPARQL)
possuem relacionamento direto com Web Semntica. Percebe-se que o termo Ontologia
no coocorre com Web Semntica. Fica evidente que os termos Web Semntica e
Ontologia no so citados em um mesmo documento. Com este cenrio pode-se afirmar que
no h relao direta entre os dois termos citados. Porm h uma relao indireta, que pode
ser evidenciada atravs da associao de elementos textuais.
32
A descoberta ABC uma tcnica utilizada na DBL para descobrir associaes entre
elementos textuais. Segundo Bovo (2011) esta tcnica consiste em descobrir relacionamentos
entre conceitos, que apesar de no coocorrerem esto conectados indiretamente por outros
conceitos. dividida em descoberta aberta e fechada. Os dois modelos de descoberta ABC,
sero apresentados a seguir.
2.1.2.1.1 Aberta
O processo de descoberta aberta seleciona um termo origem (A) e partir dissso todos
os documentos que contenham A so selecionados. Considerando os documentos
selecionados, uma anlise realizada visando extrair termos considerados relevantes por
especialistas de modo que se forme um conjunto com termos candidatos (Bs). Em seguida os
documentos que contenham B so analisados e os termos considerados relevantes por
especialistas so extraidos, formandos os Cs. A partir da relao direta entre A e B, e B e C
possivel afirmar que C e A possuem uma relao indireta, ou seja, no foram citadas
conjuntamente em nenhum documento analisado. Ao final do processo possivel gerar novas
hipteses, como observado no estudo inicial de Swanson.
2.1.2.1.2 FECHADA
afirmar que o modelo de descoberta fechada mais adequado visto que este parte de uma
hpotese que pode ou no ser validada.
Segundo Salton e Buckley (1988) A equao do cosseno mede o ngulo entre dois
vetores, variando de 1.0 (cos(0) = 1.0) para vetores apontando na mesma direo, 0.0
(cos(90) = 0.0) para vetores ortogonais e -1.0 (cos(180) = -1.0) para vetores apontando em
direes opostas. Esta equao pode ser definida como:
( )
36
( )
37
3. COMPUTAO DISTRIBUDA
Apesar da rpida evoluo dos processadores h uma constante busca por poder
computacional. Por muito tempo a soluo mais comum para este desafio foi o aumento da
capacidade de processamento dos processadores. Esta evoluo ainda hoje segue a estimativa
proposta por Gordon Moore na dcada de 70, denominada lei de Moore, que prev a
duplicao do nmero de transistores1 comportados em uma pastilha a cada 18 meses
(MOLLICK, 2006).
Neste contexto os sistemas com mltiplos processadores surgem como uma soluo
alternativa para o aumento da capacidade de processamento. De acordo com a taxonomia de
Flynn os sistemas com mltiplos processadores so classificados como MIMD (mltiplos
fluxos de instrues mltiplos fluxos de dados). A taxonomia de Flynn (Figura 9) proposta
por Michael J. Flynn ainda a maneira mais usual de organizar sistemas com capacidade de
processamento paralelo (STALLINGS, 2010).
1
O aumento do nmero de transistores proporciona maior capacidade processamento, porm esta soluo pode deixar de ser
vivel devido a limites fsicos.
38
RAM
Ranking Pas Nome Ncleos
(GB)
1 E.U.A Sequoia 1572864 1572864
2 Japo K computer 1410048 705024
3 E.U.A Mira * 786432
4 Alemanha SuperMUC * 147456
5 China Tianhe-1A 229376 186368
6 E.U.A Jaguar 298592 598016
7 Italia Fermi * 163840
8 Alemanha JuQUEEN * 131072
9 Frana Curie thin nodes 308736 77184
10 China Nebulae * 120640
Tabela 5 - Top 10 supercomputadores.
Fonte: (TOP500, 2012).
41
3.2.1 CLUSTER
Stallings (2010) possui uma viso mais contempornea e afirma que Um cluster
consiste de um conjunto de computadores completos, conectados entre si, que trabalham
juntos como um recurso computacional unificado, criando a iluso de ser uma nica
mquina. O termo computador completo utilizado, pois o sistema pode executar
independentemente do cluster.
Percebe-se que Stallings (2010) apresenta uma definio mais flexvel de cluster
quando comparada a viso de Tanenbaum e Steen (2007). A Figura 11 apresenta mtricas para
classificao de cluster proposta por Dantas.
3.2.2 GRID
Recursos: Esta camada representa os recursos que compe o grid, podendo conter:
computadores pessoais, clusters, sensores, entre outros. Alm disso, o conjunto de recursos
representado por esta camada altamente dinmico, ou seja, novos podem ser adicionados ou
retirados, e, como resultado pode haver variao do desempenho na estrutura (BERMAN;
FOX; HEY, 2003).
3.2.2.1 GridGain
O projeto que iniciou em 2005 atualmente conta com duas verses: GridGain
Community Edition que possui cdigo aberto, e a verso GridGain Enterprise Edition, que a
verso comercial do software. Neste trabalho a verso utilizada a Community Edition.
Basicamente, o GridGain trabalha com o conceito de task e jobs, sendo que uma
tarefa (task) dividida em diversos pequenos problemas (jobs). O envio dos jobs e o
balanceamento de carga fica a cargo do GridGain. Desse modo, a aplicao que est sendo
executada deve apenas definir uma task e como ela vai ser dividida dando origem aos jobs.
Aps a diviso os jobs so enviados aos ns que compem o grid para serem executados.
45
4. MODELO PROPOSTO
O modelo lgico (Figura 13) composto por um conjunto de passos que possibilitam
a interconexo de contedo textual, representado por conceitos em um domnio de problema,
visando prover suporte a tarefas de descoberta de conhecimento.
Insero e classificao dos termos (1): Nesta etapa realizada a manuteno da base de
dados. Aqui so inseridos novos termos, classes, e domnios. Um termo constitudo por mais
palavras que, quando associado a uma classe gera um conceito. A diferena entre termos e
conceitos que o segundo possui um significado, enquanto termos isolados representam
apenas palavras. Com o intuito de gerar conceitos, os termos so atribudos de acordo com as
classes inseridas. As Tabela 6, 7 e 8 exemplificam os termos, classes, e conceitos:
TERMO
Jaguar
C++
Java
Euro
Brasil
Tabela 6 - Exemplo de termos inseridos na base de dados.
CLASSE
Moeda
Linguagem de programao
Carro
Pas
Animal
Tabela 7 - Exemplos de classes presentes na base de dados.
CONCEITO
TERMO CLASSE
Brasil Pas
Jaguar Animal
Java Linguagem de programao
C++ Linguagem de programao
Jaguar Carro
Euro Moeda
Tabela 8 - Exemplos de conceitos (composto por termo e classe) presentes na base de dados.
que o processo de correlao seja aplicado para um fim especifico. Abaixo podem ser
observados exemplos de domnios na Tabela 9, e conceitos e domnios na Tabela 10:
DOMNIO
ID DESCRIO
1 Tecnologia
2 Genrico
3 Economia
4 Sade
Tabela 9 - Exemplo de domnios.
CONCEITO-DOMNIO
CONCEITO
ID DOMNIO
TERMO CLASSE
1 Jaguar Animal Genrico
2 Java Linguagem de programao Tecnologia
3 C++ Linguagem de programao Tecnologia
4 Jaguar Carro Genrico
5 Euro Moeda Economia
Tabela 10 - Exemplos de conceitos e seus respectivos domnios.
CONCEITO
DATA
TERMO CLASSE FREQUNCIA
Brasil Pas 622.000.000 25/03/2012
Jaguar Animal 24.800.000 25/03/2012
Java Linguagem de programao 239.000.000 25/03/2012
C++ Linguagem de programao 40.100.000 25/03/2012
Jaguar Carro 18.400.000 25/03/2012
EURO Moeda 765.000.000 25/03/2012
Tabela 11 - Exemplos de conceitos e suas respectivas frequncias individuais.
Envio dos trabalhos (5): aps a criao dos trabalhos o servio de correlao envia
estes para os computadores que compem a estrutura. O servio de correlao realiza o
controle de modo que quando um computador encerrar seu trabalho este receber outro
enquanto houver itens a serem processados na lista de tarefas. Este processo se repete at no
restar mais trabalhos a serem executados, assim finalizando a tarefa. As prximas etapas
descritas so executadas de forma distribuda.
CONCEITO CONCEITO
FREQUENCIA
FREQUNCIA FREQUNCIA CONJUNTA
TERMO CLASSE TERMO CLASSE
INDIVIDUAL INDIVIDUAL
Brasil Pas 622.000.000 Jaguar Animal 24.800.000 1.790.000
Brasil Pas 622.000.000 Java Lin. deProg. 239.000.000 25.300.000
Brasil Pas 622.000.000 C++ Lin. deProg. 40.100.000 2.040.000
Brasil Pas 622.000.000 Jaguar Carro 18.400.000 21.300
Brasil Pas 622.000.000 EURO Moeda 765.000.000 101.000.000
Jaguar Animal 24.800.000 Java Lin. deProg. 239.000.000 369.000
Jaguar Animal 24.800.000 C++ Lin. deProg. 40.100.000 69.000
Jaguar Animal 24.800.000 Jaguar Carro 18.400.000 194.000
Jaguar Animal 24.800.000 EURO Moeda 765.000.000 688.000
Java Lin. deProg. 239.000.000 C++ Lin. deProg. 40.100.000 18.300.000
Java Lin. deProg. 239.000.000 Jaguar Carro 18.400.000 54.600
Java Lin. deProg. 239.000.000 EURO Moeda 765.000.000 19.800.000
C++ Lin. deProg. 40.100.000 Jaguar Carro 18.400.000 87.000
C++ Lin. deProg. 40.100.000 EURO Moeda 765.000.000 1.220.000
Jaguar Carro 18.400.000 EURO Moeda 765.000.000 1.200.000
Tabela 12 - Exemplos dos resultados obtidos aps a gerao da frequncia conjunta.
A API utilizada disponibiliza formatos para resposta de uma consulta, sendo possvel
utilizar XML ou JSON. No modelo proposto a opo escolhida foi o JSON por possuir uma
representao mais simplificada em relao ao XML. Segundo Deitel e Deitel (2010), o JSON
uma alternativa XML para representar dados. Nurseitov (2009) afirmaque o JSON alm de
menor mais rpido, e usa menos recursos quando comparado ao XML. Como consequncia
o JSON vem sendo cada vez mais reconhecido como um padro adequado para tranferncia
de dados entre aplicaes (LOUDON, 2010).
Percebe-se que a mensagem JSON est resumida, pois foram retiradas informaes
que no seriam utilizadas no modelo proposto. Como visto anteriormente a nica informao
pertinente a quantidade de pginas em que o termo pesquisado se encontra. Como exemplo,
pode ser observada na Figura 15 o resultado para a busca considerando o termo ufsc como
um total de 5.290.000 pginas.
Aps a Hash ser populada o n principal inicia o processo de gerao das frequncias
individuais de todos os termos. Para obter o valor da frequncia o n principal envia uma
requisio HTTP (Hypertext Transfer Protocol) ao servidor de consulta (Bing). A requisio
pode ser observada na Erro! Fonte de referncia no encontrada.4. A resposta do servidor
e consulta um objeto JSON que contm o nmero de pginas em que o termo se encontra. O
valor de retorno atualizado na varivel frequncia encontrada no objeto termo referente
posio deste na tabela Hash. Aps isso, os termos e suas respectivas frequncias individuais
so armazenadas na base de dados. A estrutura da tabela FT_CONCEPT_TIME, responsvel
por armazenar estas informaes, pode ser observada na Figura 19.
(Figura 20). Para realizar o processo de correlao de forma distribuda a arquitetura utiliza
framework/middleware GridGain, que foi apresentado na seo 3.3.2.1.
5.1 INTRODUO
Mapa de Tpicos: Promove uma viso inicial sobre a anlise de mapa de tpicos e
sua importncia como uma ferramenta para entender determinado
contexto/domnio de aplicao. Apresenta ainda alguns casos de anlise e projeta
uma rede especfica ao longo do tempo, com intuito de exemplificao.
59
O critrio para a seleo dos termos foi a dinamicidade, ou seja, o cenrio foi
escolhido desta maneira objetivando a variao temporal dos termos que o compem. A
construo de um cenrio que visa variao temporal justificada pelo fato de que a anlise
de correlao realizada em mdio e longo prazo, sendo assim termos dinmicos podem
exemplificar resultados mais prximos da realidade.
so executadas. A seguir ser realizado um detalhamento das tabelas (fatos e dimenses) que
so influenciadas diretamente pelo servio de correlao considerando a lista de conceitos da
Tabela 15:
DI_DATE: cada execuo do servio gera uma nova entrada na tabela. Visto que a
anlise temporal esta tabela armazena a data em que o servio foi executado. A Figura 21
demonstra o contedo da tabela DI_DATE.
Outra informao pertinente que pode ser obtida atravs do processo de correlao
diz respeito aos termos mais correlacionados considerando um termo origem em particular.
Esta anlise exibida em forma de grfico, como pode ser observado na Figura 26, que tem
Crise como termo origem.
65
Esta anlise pode ser considerada a mais significativa das apresentadas. O coeficiente
de correlao mede o grau de correlao entre dois termos. Na equao utilizada no prottipo,
Phi-squared, so consideradas as frequncias individuais e conjuntas descritas anteriormente.
A Figura 27 exemplifica um histograma gerado atravs do coeficiente de correlao entre os
termos Euro e Grcia.
66
O prximo tpico descrever com maior detalhamento uma situao real observada
durante a fase em que o servio de correlao foi executado.
2
http://zerohora.clicrbs.com.br/rs/economia/noticia/2012/05/grecia-critica-merkel-por-sugerir-referendo-sobre-o-euro-
3763912.html
69
Reunio do G8 que, entre outros assuntos, abordou temas referentes crise dos
pases da zona do Euro, principalmente a Grcia;
3
http://www.estadao.com.br/noticias/internacional,g8-defende-permanencia-da-grecia-na-zona-do-euro,875182,0.htm
70
6. CONSIDERAES FINAIS
O objetivo geral desse trabalho foi desenvolver uma arquitetura que permita, de
maneira distribuda, extrair ativos de conhecimento a partir de bases textuais. Nesse sentido,
foi realizada uma reviso das reas de descoberta de conhecimento e computao distribuda
visando suportar a proposio do trabalho.
REFERNCIAS
BILLHARDT, Holger; BORRAJO, Daniel; MAOJO, Victor. A context vector model for
information retrieval. Journal Of The American Society For Information Science And
Technology, New York, p.236-249, fev. 2002.
BERMAN, Fran; FOX, Geoffrey; HEY, Tony. The Grid: Past, Present, Future. In: BERMAN,
Fran; FOX, Geoffrey; HEY, Tony (Editores). Grid Computing: Making the Global
Infrastructure a Reality. UK: Wiley and Sons, p. 9-50, mar. 2003.
DEITEL, Harvey M.; DEITEL, Paul J. Java como programar. 8. ed. So Paulo (SP):
Pearson Prentice Hall, 2010. xxix, 1144 p.
EGGHE, L.; MICHEL, C. Strong similarity measures for ordered sets of documents in
information retrieval. Information Processing and Management: an International
Journal, v. 38, n. 6, p. 823-848, 2002.
FAYYAD, U. M. Data Mining and Knowledge Discovery: Making Sense Out of Data. IEEE
Expert: Intelligent Systems and Their Applications, v. 11, n. 5, p. 20-25, 1996.
INMON, Willian H. Builging the data warehouse. 3rd ed New York: J. Wiley, 2002. 412p.
IVANOV, Nikita. Real Time Big Data Processing with GridGain, 2012. Disponvel em:
<http://www.gridgain.com/book/book.html>. Acesso em: 20 maio 2012.
KORPELA, Eric J. et al. Status of the UC-Berkeley SETI Efforts. In: INSTRUMENTS,
METHODS, AND MISSIONS FOR ASTROBIOLOGY, v. 14, 2011, San Diego.
Proceedings... San Diego: Spie, 2011.
LOPES, Paulo Afonso. Probabilidades & Estatstica. 1. ed. Rio de Janeiro: R&A, 1999, 174
p.
LYMAN, Peter; VARIAN, Hal R. How much information? Executive summary. 2003.
MOONEY, Raymond J.; NAHM, Un Yong. Text Mining with Information Extraction. In:
INTERNATIONAL MIDP COLLOQUIUM DAELEMANS, 4., September 2003,
Bloemfontein, South Africa. W., du PLESSIS, T., SNYMAN, C. and TECK, L.
(Eds.).Proceedings Bloemfontein, South Africa: Van Schaik Pub., 2005. p.141-160.
NURSEITOV, Nurzhan et al. Comparison of JSON and XML Data Interchange Formats: A
Case Study. In: INTERNATIONAL CONFERENCE ON COMPUTER APPLICATIONS IN
INDUSTRY AND ENGINEERING, 22., 2009, Bozeman. Proceedings... San Francisco,
California: Caine, 2009. p. 157 - 162.
77
PACKER, Abel Laerte; TARDELLI, Adalberto Otranto; CASTRO, Regina Clia Figueiredo.
A distribuio do conhecimento cientfico pblico em informao, comunicao e informtica
em sade indexado nas bases de dados MEDLINE e LILACS. Cinc. sade coletiva, Rio de
Janeiro, v. 12, n. 3, jun. 2007.
RAJMAN, M.; BESANON, R. Text mining: Natural language techniques and text mining
applications. In: IFIP TC2/WG2.6 WORKING CONFERENCE ON DATABASE
SEMANTICS (DS-7), 7., 1997, Leysin. Proceedings... .Chapman & Hall, 1997. p. 7 - 10.
TRIOLA, Mario F. Introduo estatstica. 10. ed. Rio de Janeiro (RJ): LTC, 2008. xxiii,
656p.
TRONCHONI, Alex B.; PRETTO, Carlos O.; ROSA, Mauro A. da.; LEMOS, Flvio A.
Becon. Descoberta de conhecimento em base de dados de eventos de desligamentos de
empresas de distribuio. Sba Controle & Automao. 2010, vol.21, n.2, p. 185-200.