Este projeto utiliza MongoDB e Python (pandas, pymongo, seaborn, matplotlib) para análise de dados de saúde relacionados ao diabetes.
mongoimport --db project_bdnsql --collection Healthcare-Diabetes --type csv --headerline --file Healthcare-Diabetes.csv
- Inserção automática de dados: Geração e inserção de dados aleatórios na coleção.
- Edição de documentos: Atualização de campos específicos em documentos.
- Busca de documentos: Consulta de documentos com diferentes operadores e filtros.
- Exclusão de documentos: Remoção de documentos da coleção.
- Funções de agregação: Cálculo de médias, máximos, mínimos e outras estatísticas agrupadas.
- Análise exploratória: Estatísticas descritivas e distribuição de frequência dos dados.
- Visualização: Gráficos de boxplot, barras e histogramas para análise visual dos dados.
Cada documento possui os seguintes campos:
IdPregnanciesGlucoseBloodPressureSkinThicknessInsulinBMIDiabetesPedigreeFunctionAgeOutcome
- Certifique-se de ter o MongoDB rodando localmente.
- Instale as dependências:
pip install pandas pymongo matplotlib seaborn
- Execute o notebook
project bdnsql.ipynbno VS Code ou Jupyter.
- Inserir dados aleatórios:
data.insert_many([...])
- Editar documento:
data.update_one({"Id": 1}, {"$set": {"Glucose": 150}})
- Buscar com operadores:
data.find({"Glucose": {"$gt": 150}})
- Agregação:
data.aggregate([{"$group": {"_id": "$Outcome", "avg_glucose": {"$avg": "$Glucose"}}}])
- Visualização:
import seaborn as sns sns.histplot(df['Glucose'])
- Boxplot da glicose por grupo (com/sem diabetes)
- Distribuição por faixa etária e outcome
Autor: Gabriel
Disciplina: Banco de Dados NoSQL
Professor: Kelly Lais Wiggers