quarta-feira, 25 de novembro de 2015

ANÁLISE DE DADOS ECOLÓGICOS Parte I

O embasamento de uma metodologia geral para analisar dados ecológicos pode ser encontrado nas relações que existem entre as condições que cercam as observações ecológicas e seus resultados. Nas ciências físicas, por exemplo, há sempre relações de causa e efeito entre as condições naturais ou experimentais e os resultados das observações ou experimentos. Isso quer dizer que, dadas certas condições, o resultado pode ser exatamente predito. Porém, essas relações determinísticas são raras na ecologia.

Geralmente, na ecologia, um número diferente de resultados pode ser encontrado a partir de um conjunto de condições por causa do grande número de variáveis atuando no sistema, das quais muitas não são disponíveis para o observador. Por outro lado, se as observações são repetidas muitas vezes sob certas condições similares, as frequências relativas de resultados possíveis tendem a estabilizar em certos valores, chamados probabilidades dos resultados.

Genericamente, é possível afirmar que sempre que dizemos que a probabilidade de um evento com respeito a um experimento (ou observação) é igual a P, o significado concreto dessa assertiva é simplesmente que em uma longa série de repetições do experimento (ou observação), é praticamente certo que a frequência (relativa) do evento será aproximadamente igual a P. Isso corresponde à teoria de probabilidade de frequências. Dessa forma, se o P de uma análise é igual a 0,03, isso significa, segundo a definição acima, que, se a mesma coleta e análise de dados for realizada 100 vezes, espera-se que o resultado encontrado ocorra com uma frequência de 3%, ou três vezes em 100. Como esse é um evento extremamente raro considerando distribuições aleatórias, supõe-se que deve haver algum efeito que esteja atuando sobre o sistema. Portanto, nesse caso o pesquisador pode assumir que há evidência (valor de P) suficiente para afirmar que há um efeito agindo sobre o resultado.

Quando cada um de muitos resultados ocorre com certa probabilidade característica, o conjunto dessas probabilidades é chamado distribuição de probabilidade (Figura 1).


Figura 1 – Dois tipos de repetição de observações


Os métodos de análise numérica são determinados pelos quatro tipos de relações que podem ser encontrados entre as condições do meio ambiente e o resultado de observações (Tabela 1). A ecologia e a maior parte das ciências biológicas lidam com métodos de análise de variáveis resposta aleatórias.


Tabela 1 – Análise numérica de dados ecológicos.

 A qualidade da análise e interpretação subsequente de dados biológicos depende, particularmente, da compatibilidade entre os dados e os métodos numéricos (a estatística). É importante levar em consideração os requisitos das técnicas quando se planeja um programa de amostragem, pois é obviamente inútil coletar dados quantitativos que são inapropriados para as análises numéricas pretendidas. A experiência mostra que, muito frequentemente, coleções mal planejadas de dados ecológicos, somente para objetivo de levantamentos, geram grandes quantidades de dados inúteis. A Figura 2 mostra as relações entre as várias fases de uma pesquisa ecológica.


Figura 2 – Relações entre as várias fases de uma pesquisa ecológica.

Isso quer dizer que a pesquisa deve ser cuidadosamente planejada, desde o embasamento teórico, passando pelos objetivos, os métodos para coletar os dados adequados e as análises estatísticas que atingirão os objetivos propostos. Uma pergunta bem formulada vale muito mais, em se tratando de métodos de coleta e análise, do que a coleta indiscriminada de múltiplas variáveis em campo. Não se pode esperar que a estatística resolva desenhos mal pensados. Em geral, ela não o faz!


Nas ciências biológicas, a análise numérica dos dados não é um objetivo em si. Ou seja, é preciso abandonar a visão de que a estatística tudo pode e tudo resolve. Em geral, perguntas simples levam a desenhos bem realizados e análises diretas que resultam em dados facilmente interpretáveis à luz dos objetivos. Entretanto, um estudo baseado em informação quantitativa deve levar o processamento de dados em conta em todas fases do trabalho, desde a concepção até a conclusão, incluindo o planejamento e a execução da amostragem, a análise apropriada dos dados e a interpretação dos resultados. A amostragem, incluindo as análises laboratoriais, geralmente é a parte mais cara e tediosa de uma pesquisa e, portanto, é importante que ela seja otimizada para reduzir ao mínimo a coleção de informação inútil. Assumindo que procedimentos adequados de amostragem e de laboratório tenham sido empregados, as conclusões dependerão dos resultados da análise de dados. É, portanto, importante se certificar antecipadamente que a amostragem e as técnicas numéricas são compatíveis. Toda amostragem começa com a determinação da unidade experimental e das variáveis que serão medidas nessas unidades experimentais. Uma vez determinado isso, segue-se que a análise dos dados é relativamente simples. Então, o processamento numérico está no cerne da pesquisa biológica e a qualidade dos resultados não pode exceder a qualidade das análises numéricas conduzidas nos dados.


Objetivos específicos claros e bem determinados levam à formulação de hipóteses também claras e objetivas. Para cada variável resposta coletada, há uma hipótese científica associada, a qual, em geral, corresponde à hipótese estatística alternativa. Quanto maior o número de variáveis coletadas, mais hipóteses podem ser formuladas. Isso pode ser um problema caso o(a) pesquisador(a) não tenha muito bem claro quais são seus objetivos e as hipóteses associadas. Por exemplo, para uma variável resposta sujeita a dois efeitos, há três hipóteses estatísticas: a interação significativa entre os dois efeitos, a significância de um efeito e a significância do outro efeito. Ou seja, nesse caso, pode haver algum tipo de interação entre os efeitos, o que leva a uma interpretação totalmente diferente da análise comparada com a análise de apenas um efeito sobre a variável resposta. Por isso, é imprescindível que as perguntas sejam claramente definidas.

Claro que a qualidade de uma pesquisa biológica não é apenas uma função da competência com que o trabalho quantitativo é conduzido. Depende também largamente na criatividade, que se traduz na imaginação e intuição de formular hipóteses e teorias. É vantajoso, entretanto, que as habilidades criativas do pesquisador estejam embasadas em trabalhos empíricos sólidos (i.e. trabalho envolvendo dados de campo), pois pouco progresso pode resultar de continuamente montar hipóteses não testadas. Isso quer dizer que os pesquisadores devem se apropriar do conhecimento teórico do seu campo de pesquisa.


A Figura 2 mostra que uma interpretação correta das análises requer que a fase de amostragem seja planejada para responder uma (ou mais) questão específica. Programas de amostragem são desenhados de forma a capturar a variação ocorrendo ao longo de eixos de interesse: espaço (habitats), tempo, ou outras variáveis biológicas indicativas. O objetivo é descrever a variação ocorrendo ao longo de um ou mais eixos e interpretá-la ou modelá-la.

Texto adaptado (com recortes e alterações) de Legendre & Legendre, 2012. Numerical Ecology. p. 1-8.

sábado, 1 de agosto de 2015

O que é diversidade beta?

O que é diversidade beta? Em resumo, pode ser definida como diferenças na composição das espécies entre dois lugares ou tempos. Uma propriedade importante da biodiversidade é que ela não é distribuída de forma equilibrada no globo. Isso quer dizer que diferentes áreas geralmente contêm diferentes comunidades biológicas. Medir a diferença entre as comunidades biológicas é um passo importante para se entender como e por que a biodiversidade se distribui.

Quem introduziu o termo diversidade beta foi R.H. Whittaker em 1960, que o definiu como "a extensão de mudança na composição da comunidade, ou grau de diferenciação da comunidade, em relação a um gradiente ambiental complexo, ou um padrão de ambientes". Ele propôs várias maneiras de medir a diversidade beta. Em sua forma mais simples, a diversidade beta é definida como a razão entre a diversidade gama (regional) e a diversidade alfa (local). A diversidade regional é o conjunto total de espécies de um conjunto de locais. Bom frisar que a diversidade regional NÃO é a soma das diversidades locais, pois uma mesma espécie pode fazer parte de mais de uma comunidade local. A diversidade local, stricto sensu, é o número de espécies presentes em apenas uma área. Porém, no cálculo da diversidade beta de Whittaker, a diversidade local é definida como a média de todas diversidades locais do conjunto de comunidades sendo analisado. Então, a diversidade beta é o número efetivo de unidades composicionais diferentes em uma região. Essencialmente, a diversidade beta quantifica o número de comunidades diferentes em uma região. Então, fica claro que a diversidade beta, além de levar em conta a relação entre a diversidade local e a regional, também informa sobre o grau de diferenciação entre as comunidades biológicas. Isso porque as diversidades gama e alfa serão diferentes se (e somente se) as comunidades biológicas em uma região forem diferentes.

É fácil demonstrar como a diversidade beta varia da mínima à máxima diferenciação das assembleias locais em uma região. Utilizando a riqueza de espécies (número de espécies) como exemplo, pode-se perceber que, quando as assembleias locais são idênticas (diferenciação mínima), a diversidade local iguala a diversidade gama e a diversidade beta é igual a 1. A figura abaixo ilustra a composição de espécies de três comunidades locais. Como as cinco espécies ocorrem igualmente em cada comunidade, a diversidade gama é 5, a diversidade alfa média é 5 (5+5+5/3). A razão entre as duas é 1.


Nesse caso, nessa região, só há uma unidade composicional distinta, ou seja, apenas uma "comunidade".

Quando as comunidades locais são completamente diferentes, ou seja, apresentam diferenciação máxima, a diversidade gama é igual à multiplicação da diversidade alfa pelo número de áreas (N). Então, a diversidade beta é igual a N. Isso significa que há N unidades composicionais distintas, ou N "comunidades" diferentes (figura abaixo).


Como a diversidade beta é influenciada pelo número de áreas na região (N) na medida acima, ela não é independente da quantidade de áreas. Então, é necessário padronizar a diversidade beta. Há variantes da fórmula padrão que padronizam a diversidade beta. Um exemplo é o índice de Sorensen, que é simplesmente (diversidade beta - 1 / N - 1). É necessário cuidado na hora de escolher um método de medida de diversidade beta. Geralmente, se fala em índices de dissimilaridade, ou seja, de distância entre comunidades. Nem todos índices são apropriados para se medir diferenças entre as comunidades biológicas (veja Legendre & De Cáceres, 2013).

Porém, a diferença entre comunidades biológicas pode ter mais de um significado, que revertem a diferentes processos biológicos. Como escrito acima, a diversidade beta é o grau de diferenciação na composição entre comunidades locais e isso nos remete a pensar em substituição de espécies (turnover). As três áreas da figura abaixo ilustram esse padrão. A diversidade beta das três áreas é = 2, pois gama = 8 e alfa média = 4.


Porém, pode haver um padrão de perda aninhada de espécies do local mais rico para o menos rico, como mostra a figura abaixo. Isso causa uma diferenciação na diversidade alfa e gama. O padrão é diferente, mas o valor de diversidade beta é o mesmo que no exemplo anterior (2).


Ainda pode haver uma mistura dos dois padrões, como ilustrado na figura abaixo. A diversidade beta continua a mesma (2).


Então, nos três exemplos, a diversidade alfa e gama são idênticas, então a diversidade beta de Whittaker e o índice de Sorensen também têm os mesmos valores.

Felizmente, há uma forma de separar os valores de diversidade beta produzidos por esses dois padrões. O índice de dissimilaridade de Simpson remove os efeitos da riqueza (número de espécies) sobre a diferença entre comunidades. Esse índice considera que assembleias aninhadas são perfeitamente similares e provê o componente de substituição da diversidade beta. Se não há diferença de riqueza, os índices de Simpson e Sorensen apresentam o mesmo valor, o que significa que qualquer diferença entre os dois valores será por causa do componente aninhado da dissimilaridade. Dessa forma, a dissimilaridade total (Sorensen) pode ser particionada aditivamente nos componentes de substituição e aninhamento. A mesma abordagem pode ser utilizada para separar os componentes de dissimilaridade baseados na abundância, na dissimilaridade funcional e na dissimilaridade filogenética.

Esse texto é uma adaptação da publicação do Dr. Andrés Baselga "What is Beta Diversity?", lançada no blog sobre Métodos em Ecologia e Evolução. As figuras também são adaptações das figuras originais.
Link para o texto original: (https://methodsblog.wordpress.com/2015/05/27/beta_diversity/).

Algumas referências para leituras adicionais:


Baselga, A. (2010) Partitioning the turnover and nestedness components of beta diversity. Global Ecology and Biogeography, 19, 134-143.
Baselga, A. (2012) The relationship between species replacement, dissimilarity derived from nestedness, and nestedness. Global Ecology and Biogeography, 21, 1223-1232.
Baselga, A. & Leprieur, F. (2015) Comparing methods to separate components of beta diversity. Methods in Ecology and Evolution, in press.
Baselga, A. & Orme, C. D. L. (2012) betapart: an R package for the study of beta diversity. Methods in Ecology and Evolution, 3, 808-812.
Carvalho, J. C., Cardoso, P. & Gomes, P. (2012) Determining the relative roles of species replacement and species richness differences in generating beta-diversity patterns. Global Ecology and Biogeography, 21, 760–771.
Chao, A., Chiu, C.-H. & Hsieh, T. C. (2012) Proposing a resolution to debates on diversity partitioning. Ecology, 39, 2037-2051.
Legendre, P. (2014) Interpreting the replacement and richness difference components of beta diversity. Global Ecology and Biogeography, 23, 1324–1334.
Leprieur, F., Albouy, C., De Bortoli, J., Cowman, P. F., Belwood, D. R. & Mouillot, D. (2012) Quantifying phylogenetic beta diversity: distinguishing between ‘true’ turnover of lineages and phylogenetic diversity gradients. PLoS One, 7, e42760.
Simpson, G. G. (1943) Mammals and the Nature of Continents. American Journal of Science, 241, 1-31.
Simpson, G. G. (1960) Notes on the measurement of faunal resemblance. American Journal of Science, 258, 300-311.
Villeger, S., Grenouillet, G. & Brosse, S. (2013) Decomposing functional β-diversity reveals that low functional β-diversity is driven by low functional turnover in European fish assemblages. Global Ecology and Biogeography, 22, 671–681.
Whittaker, R. H. (1960) Vegetation of the Siskiyou Mountains, Oregon and California.Ecological Monographs, 30, 280-338.

sábado, 2 de agosto de 2014

CARACOL ESTRANGEIRO CAUSA ESTRAGOS

Achatina fulica 
Nos últimos anos, houve um aumento em casos de meningite transmitidos por um caracol alóctone. Alóctone porque é africano, ou seja, de outro lugar. Esse animal carrega um inquilino nada amistoso: um parasita que pode infectar os seres humanos. Porém, antes disso, esse pequeno bastardo passa por dentro de ratazanas. Esses animais que hospedam o molusco são chamados de vetores. A ingestão do caracol ou do seu muco pode fazer de uma pessoa o seu hospedeiro final. Percebe-se que infecções, provavelmente, estão correlacionadas com falta de infraestrutura básica, um drama ainda no nosso país cada vez mais "rico".
A introdução de espécies exóticas, tal como o caramujo africano, pode ter um efeito deletério. Com o aumento da intensidade da troca de produtos e serviços entre os países, proporcionado pela globalização, introduções indesejáveis são rotina. Porém, geralmente, não temos essa percepção, pois os efeitos atuam sobre outros animais e sobre as plantas. Quando a coisa afeta os animais pensantes, a divulgação é feita. Há uma discussão intensa sobre as introduções no mundo todo. Danos aos ecossistemas e, consequentemente, às finanças de países são grandes. Essas interações entre espécies são um exemplo do que Darwin chamou de "sobrevivência do mais apto". Só que os mais aptos a viver nos ecossistemas de origem são os nativos. Os organismos introduzidos evoluíram em outro lugar. Mas, e se pensarmos o planeta como um só lugar? O fato é que se o homem não se encarregasse de ligar todas as partes do globo, os organismos permaneceriam em evolução constante e lenta nos seus próprios ecossistemas. Esse novo cenário natural é ruim? Quando o impacto de um organismo alóctone é significativamente negativo? Quando afeta a economia?

NOVA CARA
                 NEW FACE

EXPRESSION

                                                                ECOS

terça-feira, 4 de março de 2014

A DITADURA DO R



A estatística é uma disciplina indissociável das práticas científicas. Para o estudo científico dos fenômenos biológicos, a estatística é uma ferramenta que possibilita lidar com as quantificações que fazem parte do cotidiano de qualquer cientista e resumi-las, sintetizá-las e interpretá-las. A base para o estudo da estatística é a teoria das probabilidades. Então, todo e qualquer pacote estatístico está, necessariamente, ligado ao desenvolvimento de “rotinas”, ou caminhos, que se utilizam dos dados medidos pelo cientista para gerar distribuições de probabilidades, as quais serão contrastadas com uma série de distribuições ideais (normal ou gaussiana, por exemplo) ou com distribuições ligadas aos próprios dados (autorreamostragem, por exemplo).

De tempos em tempos, alguns pacotes estatísticos se tornam a escolha de muitos cientistas. Geralmente, nesses casos, o que motiva essa disseminação é o próprio uso do pacote em artigos científicos “de ponta”, motivando os leitores a procurarem se inteirar sobre ele. Isso cria uma retroalimentação positiva: quanto mais cientistas se utilizam do pacote, maior a probabilidade de disseminação do mesmo entre os pares.

Não estou aqui julgando se um determinado pacote estatístico é melhor ou pior que outro. Até porque, em se tratando de testes estatísticos, como frisei acima, a base é a mesma e, portanto, dois pacotes estatísticos devem, necessariamente, produzir os mesmos resultados para os mesmos testes (observe-se, porém, que testes de permutação podem resultar em valores um pouco diferentes dependendo do pacote e até mesmo dentro do mesmo).

Porém, quando um determinado pacote estatístico se torna uma “moda” entre os pesquisadores, começam a surgir algumas armadilhas intrínsecas, que podem resultar em alguns vieses no conhecimento científico. Vou dar um exemplo empírico. Em um exercício de correlação, um determinado aluno se utiliza do pacote estatístico R para montar uma matriz de coeficientes de correlação de Pearson (r) entre as variáveis de interesse. Perguntado pelo valor da significância das correlações, o aluno diz que “não existem”. Oras, como assim? O aluno responde que “não tem no R”. Esse é um exemplo clássico da confusão que pode se instalar na mente de um aluno. Se não existe no pacote estatístico, então não existe! Aqui, não se trata de saber se há esse teste ou não no pacote em questão.

Há uma diferença enorme entre o que um pacote estatístico faz (e que é seu objetivo) e o conhecimento científico (estatístico, nesse caso, mas como frisei acima, a estatística chega a ser indissociável da ciência moderna). O pacote não transmite conhecimento científico inequívoco. Ele é uma ferramenta. Claro que, nesse exemplo, o aluno foi esclarecido pelos pares sobre a existência do teste de significância. Porém, não sem antes espantar-se de que isso existisse “fora do R”.

Existem vários pacotes estatísticos disponíveis por aí. Nenhum deles melhor ou pior. Melhor é aquele com o qual nos “sentimos melhor” (facilidade de manuseio, capacidade gráfica, interatividade, etc.). Na verdade, talvez até utilizemos mais de um pacote, dependendo da situação e da nossa formação.

A estatística é uma ferramenta e como tal deve ser percebida. Uma ferramenta importantíssima e muito poderosa. Por isso, deve sempre ser utilizada com parcimônia. Nenhum pacote substitui um especialista ou um bom livro texto de estatística. Porém, todos os resultados dos testes, quando bem aplicados, devem servir para nos auxiliar a responder nossa questão biológica. Aliás, uma ótima maneira de não se perder nesse universo de estatística é formular as perguntas e hipóteses biológicas de nossos estudos a partir do olhar nos sistemas biológicos. A análise que será realizada é um passo posterior. Inverter esse caminho pode ser pernicioso, pois estaremos diante do resultado de um teste e não teremos a mínima ideia de como interpretá-lo.

quinta-feira, 13 de fevereiro de 2014

PCA PARA INICIANTES - revisitado


Vetores principais, valores principais e redução de dimensões
  
Análise de componentes principais é um dos métodos estatísticos multivariados mais antigos. Teremos uma noção bem geral da ACP (ou PCA, Principal Component Analysis), descrevendo os autovalores e autovetores e mostrando como se pode reduzir as dimensões dos dados utilizando essa técnica. Apesar da matemática ser um pouco complicada, só precisaremos ter uma ideia geral do que acontece para sermos capazes de usar essa ferramenta de maneira efetiva.

Vamos utilizar, na medida do possível, a menor quantidade de matemática e muitas figuras.

O que é Análise de Componentes Principais?

Em primeiro lugar, o nome já é uma boa pista. Ela faz o que se propõe, ou seja, encontra os componentes principais dos dados.

É geralmente útil medir dados em termos de seus componentes principais, ao invés de utilizar gráficos multidimensionais (imagine 10 dimensões!). Então, o que são componentes principais? Eles são as estruturas subjacentes básicas dos dados. São as direções nas quais há a maior variância, as direções onde os dados estão mais dispersos. Isso é fácil de explicar através de um exemplo. Na figura abaixo há alguns triângulos espalhados de forma oval:

Imagine que os triângulos são pontos de um conjunto de dados. Para achar a direção onde há maior variância, deve-se encontrar a linha onde os dados estão mais dispersos quando são projetados nela. Uma linha vertical com os dados projetados pode ser traçada da seguinte forma:


Há alguma dispersão, mas notamos que alguns triângulos possuem muito pouca distância (variância) da linha, enquanto outros estão muito distantes. Nesse caso, não há muita variância, o que sugere que esse não é o componente principal.

Vamos, agora, projetar uma linha horizontal nesses mesmos dados.



Nesse caso, podemos notar que os dados estão muito mais dispersos em relação à linha horizontal e, portanto, há maior variância sendo representada. Na verdade, nesse caso, não há outra linha que se possa traçar que representará maior variância do que a linha horizontal.

Afortunadamente, podemos utilizar a matemática para encontrar o componente principal ao invés de termos que ficar desenhando linhas para encontrá-lo. E é aqui que os autovetores e autovalores entram em cena.

Autovetores e autovalores

Quando temos um conjunto de dados, como os triângulos do exemplo, podemos desconstruir esse conjunto em autovetores e autovalores. Autovetores e autovalores existem aos pares: cada autovetor tem um autovalor correspondente. Um autovetor é uma direção. No exemplo acima, o autovetor é uma direção da linha (vertical, horizontal, 45 graus, etc.). Um autovalor é um número que nos diz quanta variância há nos dados naquela direção. No exemplo acima, o autovalor é um número que diz o quanto os dados estão espalhados na linha traçada. O autovetor com o maior autovalor é, portanto, o componente principal.

Ok, então, mesmo que eu pudesse, no exemplo acima, desenhar minha linha em qualquer direção, acontece que não há muitos autovetores/autovalores em um conjunto de dados. Na verdade, a quantidade de autovetores/autovalores que existem é igual ao número de dimensões que o conjunto de dados possui. Digamos que eu esteja medindo idade e horas na internet em um grupo de pessoas. Há duas variáveis, ou seja, é um conjunto de dados com duas dimensões. Portanto, há dois autovetores/autovalores. Se estou medindo idade, horas na internet e horas no celular, há três variáveis, um conjunto de dados de 3 dimensões (3-D), então 3 autovetores e autovalores. O motivo para isso é que autovetores colocam os dados em um novo conjunto de dimensões e essas novas dimensões devem ser iguais ao número original de dimensões. Isso parece complicado, mas, novamente, um exemplo deve tornar claro.

Abaixo, vemos um gráfico com o conjunto oval de triângulos:



Nesse momento, os dados ovais estão em um eixo x-y. O eixo “x” pode ser idade e o “y” horas na internet. Essas são as duas dimensões nas quais os dados estão sendo medidos. Agora, lembre-se que o componente principal desse conjunto oval de dados é uma linha que o divide pelo maior comprimento:


Acontece que o outro autovetor (lembre-se que há apenas dois deles, pois estamos olhando para um conjunto 2-D) é perpendicular ao componente principal. Como dissemos, os autovetores devem ser capazes de abranger toda área x-y. Para fazer isso (mais eficientemente), as duas direções devem ser ortogonais (ou seja, 90 graus). Por isso que os eixos “x” e “y” são ortogonais. Seria realmente estranho se o eixo “y” estivesse a 45 graus do eixo “x”. Então, o segundo autovetor apareceria assim: 



Os autovetores nos deram um eixo muito mais útil para colocar os dados. Agora, podemos reorganizar os dados nessas novas dimensões mais ou menos dessa forma:


Note que nada foi feito aos próprios dados. Estamos apenas olhando para eles de outra forma. Então, o uso de autovetores nos leva de um conjunto de eixos para outro. Esses eixos são muito mais intuitivos em relação à forma dos dados agora. Nessas direções é onde estão as maiores variações e, por consequência, é onde há maior informação (pense de forma inversa, se não houvesse variação nos dados [se tudo fosse igual a 1], então, não haveria informação. Nesse cenário, o autovalor para aquela dimensão seria 0 (zero), pois não haveria variação).

Mas o que esses autovetores realmente representam? Os eixos antigos eram bem definidos (idade e horas na internet, ou quaisquer duas variáveis que foram explicitamente medidas), enquanto os novos eixos não o são. Aqui é onde precisamos pensar. Há, geralmente, uma boa razão para que esses eixos representem melhor os dados, mas a matemática não irá lhe dizer, você terá que pensar a respeito (aqui, entra a parte do significado, ou seja, o objetivo maior da análise relacionado com o objetivo e a hipótese de seu estudo).

Como uma ACP e os autovetores nos ajudam de verdade na análise de dados? Bem, há alguns usos, mas o maior deles é a redução de dimensões.

Redução de dimensões

ACP pode ser utilizada para reduzir as dimensões de um conjunto de dados. A redução de dimensões é análoga ao reducionismo filosófico. Reduz os dados em seus componentes básicos, deixando fora qualquer parte desnecessária.

Vamos dizer que tenhamos medido três variáveis: idade, horas na internet e horas ao celular. Há 3 variáveis, então é um conjunto de dados 3-D. Três dimensões são representadas por um gráfico “x”, “y” e “z”. Ele mede largura, profundidade e altura (como as dimensões do mundo real). Agora, imagine que os dados tenham uma forma oval, como acima, mas que essa forma oval está em um plano, ou seja, todos os pontos de dados estão posicionados em duas dimensões (como em um pedaço de papel) dentro desse gráfico 3-D (tendo largura e profundidade, mas não altura), assim:


Quando encontramos os três autovetores e autovalores do conjunto de dados (lembre-se, um problema 3-D = 3 autovetores), dois dos autovetores terão grandes autovalores e um deles terá um autovalor de zero. Os primeiros dois autovetores mostrarão a largura e a profundidade dos dados, mas pelo fato de não haver altura nos dados (eles estão em um pedaço de papel), o terceiro autovalor será zero. Na figura abaixo, ev1 é o primeiro autovetor (aquele com o maior valor, o componente principal), ev2 é o segundo vetor (que não tem um autovalor nulo) e ev3 é o terceiro autovetor, que tem um autovalor de zero.



Podemos, agora, rearranjar nossos eixos para estarem ao longo dos autovetores, ao invés de idade, horas na internet e horas ao celular. Entretanto, sabemos que ev3, o terceiro autovetor, é inútil. Então, ao invés de representar os dados em três dimensões, podemos nos livrar da direção inútil e apenas representá-los em duas dimensões, como antes: 


Isso é redução de dimensões. Reduzimos um problema 3-D para um problema 2-D, nos livrando de uma dimensão. A redução de dimensões ajuda a simplificar os dados e torna a visualização mais fácil.

Note que podemos reduzir dimensões mesmo que o autovalor não seja zero. Imagine o exemplo novamente, só que ao invés da forma oval dos dados ser em um plano 2-D, há uma pequena quantidade de altura neles. Ainda haverá 3 autovetores, mas dessa vez todos serão diferentes de zero. Os valores serão algo como 10, 8 e 0,1. Os autovetores correspondendo a 10 e 8 são as dimensões onde há muito mais informação; o autovetor correspondendo a 0,1 não terá muita informação. Então, podemos descartar o terceiro autovetor novamente de forma a tornar os dados mais simples.

ACP (ou PCA, como mais comumente conhecida) é uma técnica de análise muito utilizada na ecologia. Geralmente, ela é utilizada para reduzir as dimensões de grandes conjuntos de dados de variáveis explicativas em duas ou três dimensões que traduzem a maior parte da variância dos dados. A posteriori, esses novos dois ou três vetores podem ser utilizados como novas variáveis explicativas em análises de regressão ou canônicas. Em geral, essa técnica terá melhores resultados se utilizada em matrizes de dados altamente correlacionados (multicolinearidade alta). Por quê? Em se tratando de dados com alta correlação, espera-se que a covariância entre eles seja grande e, portanto, a variância que será explicada nos primeiros componentes (aqueles que extraem a maior variância) será maior, de modo que os dados serão reduzidos a poucos, em geral dois, componentes. Adicionalmente, a multicolinearidade é resolvida, pois os componentes principais (autovetores) resultantes são ortogonais!

É importante observar que esse tipo de ordenação não é ideal para investigar matrizes de abundâncias de espécies, pois ela está baseada especificamente em distâncias Euclidianas. Esse tipo de distância é limitada para descrever diferenças entre comunidades. Porém, há algumas transformações, que podem ser feitas na matriz de abundâncias, que a tornarão adequada para o uso com PCA. Essa observação é especialmente relevante quando se pensa em usar RDA (Análise de Redundância), já que um dos passos dessa análise envolve a realização de uma PCA.