Escolar Documentos
Profissional Documentos
Cultura Documentos
1. Visão geral
O desafio envolvido na tarefa conhecida como clusterização pode ser enunciado da
seguinte forma:
dados. Ao final, espera-se que cada grupo (cluster) identificado exiba alguma
Agora, não há mais uma saída conhecida a ser aproximada para cada padrão de
entrada.
uma função que descreva de maneira adequada a estrutura dos dados não-
rotulados.
do agrupamento?
de vista e/ou das hipóteses consideradas com respeito à natureza dos dados.
qualidade da clusterização,
clusterização ainda que eles não sejam definitivos e que não haja
O critério AIC (AKAIKE, 1974) foi concebido com base numa estimativa da
dados.
(1)
O critério BIC (SCHWARZ ET AL., 1978) foi criado com base em uma estimativa da
(2)
Nota: Os critérios AIC e BIC podem ser usados para a seleção de modelos em
representação gráfica sucinta do quão bem cada objeto se situa dentro do seu cluster.
próprio cluster (coesão) quando comparado com outros clusters (separação). Seu
valor está restrito ao intervalo , sendo que um valor elevado indica que o
ou negativo para o coeficiente silhouette, então a clusterização pode ter sido feita
Seja a menor distância média entre e todos os clusters dos quais não é
forma:
(3)
(4)
que indica o quão dissimilar é o padrão com respeito a seu próprio cluster, um
valor pequeno significa que ele se encaixa bem nas características do cluster. Além
disso, um valor elevado de implica que não se encaixa bem no cluster vizinho.
Portanto:
cluster vizinho.
próximo de zero significa que o dado está próximo da fronteira entre dois
clusters naturais.
Análise:
clusterizados.
Gráficos do coeficiente silhouette para cada padrão podem ser utilizados para
(5)
∈
para .
significativos.
Sendo assim, o índice de Davies-Bouldin (DAVIES & BOULDIN, 1979) (DBI) é definido
.
.
Se e , então
Se e , então
mais concentrada é a dispersão dentro dos clusters. Uma solução que satisfaz estes
requisitos corresponde a:
(7)
(8)
(9)
clusterização.
desafio é encontrar uma atribuição dos dados aos clusters, bem como um conjunto
Função objetivo:
Seja
, (10)
Parâmetros a determinar
clusters existentes.
No segundo passo, dada a atribuição dos dados aos clusters, minimizamos com
Primeiro passo:
, (11)
,
, (12)
Segundo passo:
, (13)
𝛍
, (14)
Logo,
anteriores até que um critério de parada (e.g., variação nas posições dos protótipos
Características:
também, ser sensível a outliers, uma vez que o critério explora a norma do
vetor diferença.
protótipos para ver qual será escolhido para representar o padrão de entrada. Neste
Explora uma medida de dissimilaridade mais geral entre cada padrão e cada
dissimilaridade adotada, pode não ser possível obter uma solução simples e em
atribuídos ao cluster . Usualmente, opta-se pelo padrão que, sendo visto como
Exemplo:
Figura. À esquerda, são mostrados os valores do coeficiente silhouette para cada padrão de entrada. O valor
médio (em vermelho) foi igual a 0,7049.
0,7049. À direita, observamos os protótipos obtidos pelo 𝑘-means para o
caso em que 𝑘 = 2,, bem como a separação dos dados nos dois clusters.
é atribuído a um, e somente um, cluster. Este tipo de decisão rígida, conhecida
como hard assignment, pode ser razoável para dados situados a uma distância
tipo soft-assignment.
Condição de otimalidade:
, (19)
Assim,
,
(20)
,
, .
Multiplicadores de Lagrange:
, , , , (21)
,
, (22)
,
, , (23)
,
Com isso,
Usando (22):
, (25)
( ) ( ) ( ) ( )
(26)
, ,
Logo,
( )
( ) (27)
( )
, (29)
( ) ( )
,
, ,
Com isto, o algoritmo fuzzy -means pode ser resumido através do seguinte pseudo-
código:
(c) 𝛽 = 3
Figura. Os círculos numerados representam os protótipos (𝛍( , 𝑖 = 1, … ,3)) obtidos ao final da execução do
algoritmo fuzzy 𝑘-means.. Em cada ponto do espaço de entrada, a cor codifica o nível de pertinência daquele
dado em relação aos clusters.
Tópico 8: Aprendizado Não-Supervisionado
Supervisionado – Clusterização
Funções de pertinência ( ):
(c) Cluster 2
que cada cluster no espaço de atributos pode ser bem representado por uma função
explora esta ideia supondo que os dados foram amostrados com base numa
(30)
(𝐱 𝛍 ) 𝚺 (𝐱 𝛍 )
/ /
(31)
Restrições:
.
.
explicar a observação .
(32)
Ora:
.
.
.
Portanto:
(33)
Cada e .
que cada uma representa uma atribuição específica de um padrão a uma das
.
.
Assim, .
Logo,
(34)
Com isto,
Para cada vetor observado, existe uma única variável latente correspondente.
Dados: ×
.
verossimilhança como:
(36)
(37)
/
(38)
indesejáveis.
detectar se uma componente gaussiana está colapsando para uma das amostras e,
então, reinicializar sua média para um vetor aleatório, e sua matriz de covariâncias
contornado.
Desafio:
𝚷,𝚳,𝚺
(39)
(40)
Então:
(41)
( |𝐱 )
(43)
Com isto,
(44)
a .
Ora,
(𝐱 𝛍 ) 𝚺 (𝐱 𝛍 )
/ /
(46)
(47)
Então,
(48)
(𝐱 𝛍 ) 𝚺 (𝐱 𝛍 )
Seja ( ) / |𝚺 | /
.
Então, .
(49)
Propriedades:
a) .
𝚺 𝚺
|𝐌|
b) .
𝐌
(50)
𝐚 𝐌𝐛 (𝐱 𝛍 ) 𝚺 (𝐱 𝛍 )
c)
𝐌 𝚺
Portanto:
(51)
Retornando a (45):
(53)
Então,
(54)
Finalmente,
(56)
𝚷,𝚳,𝚺,
(57)
(59)
Então:
(60)
(61)
Tomando a
Com isso,
(63)
(64)
𝑁 = 𝑃(𝑘 |𝐱 ) ( ) 1 ( ) ( )
𝚺 = 𝑃(𝑘 |𝐱 ) 𝐱 − 𝛍 𝐱 −𝛍
𝑁
( )
1 ( )
𝑁
𝛍 = 𝑃(𝑘 |𝐱 )(𝐱 ) 𝜋 =
𝑁 𝑁
4. Avalie a log-likelihood:
( ) ( ) ( )
ln 𝑃(𝐗|𝚷, 𝚳, 𝚺) = ln 𝜋 𝐺 𝐱 ;𝛍 ,𝚺
5. Repita os passos 2 a 4 caso não tenha ocorrido convergência da log-likelihood e/ou dos
parâmetros.
(BISHOP, 2006).
um ótimo local.
Assim como ocorre no caso do algoritmo fuzzy -means, cada padrão de entrada
equivalentemente, de ter sido gerado por cada uma das componentes gaussianas.
Podemos usar o -means para obter uma inicialização mais adequada para os
para a -ésima componente, os dados atribuídos ao cluster . Por fim, pode ser
Exemplo:
Figura. Distribuição dos dados disponíveis, os quais, por construção, estão associados a três diferentes
agrupamentos (clusters),
), gerados por distribuições gaussianas com diferentes matrizes de covariâncias.
covariâncias
(DBSCAN), proposto em (Ester et. al., 1996), é um método que usa a informação da
rotulada como sendo um ponto central, um ponto de fronteira ou, então, ruído; (ii)
próprio). Todos os pontos dentro deste raio de vizinhança são ditos diretamente
alcançáveis por .
Todos os pontos que não são centrais nem de fronteira são considerados como
ruído.
Uma vez que todos os padrões foram rotulados, o algoritmo DBSCAN constrói os
Cada ponto central forma um cluster juntamente com todos os pontos (centrais ou
existe algum outro ponto tal que tanto quanto são alcançáveis por .
propriedades:
por densidade.
densidade com qualquer ponto de um cluster, então ele também deve fazer
Vantagens:
Não requer que o número de clusters seja pré-especificado; além disso, pode
Desvantagens:
clusters são, então, sequencialmente combinados em clusters maiores, até que todos
Em cada etapa, os dois clusters separados pela menor distância são combinados. A
Algumas opções:
𝐱∈ 𝐱 ∈
único cluster.
5 6
1
8
4
7 9
3
(possivelmente radiais).
(preservação topológica).
número de entradas.
…
𝑥1 𝑥2 𝑥𝐾
vinculado ao arranjo), mas há também uma relação entre os pesos dos neurônios no
Exemplos bidimensionais:
...
x1 x2 xdim
chamado de best matching unit, BMU). Então, o seu vetor de pesos é ajustado na
Seja o neurônio vencedor. Então, uma opção para o processo de aprendizado não-
wj(k) (x(k)wj(k))
wj(k+1)
x(k)
próximos.
vizinhança vizinhança
vk
BMU
Figura. BMU (Best Matching Unit) e seus vizinhos (figuras extraídas de ZUCHINI, 2003).
O neurônio que venceu para uma dada amostra é o que sofre o maior ajuste. No
rede.
Figura. Conjunto de features associadas a cada espécie de animal presente no conjunto de dados Extraída de
(HAYKIN, 2008).
0.5
-0.5
2
-1
0
-1.5
3
2 1 0 -1 -2
-2