R语言实战:5分钟搞定NHANES数据库的加权分析与可视化(附完整代码)
公共卫生研究和流行病学分析中,NHANES数据库是公认的宝藏数据源。但面对复杂的抽样设计和权重计算,许多研究者常常望而却步。本文将带你用R语言快速突破技术瓶颈,从数据下载到可视化呈现,5分钟完成全流程分析。
1. 环境准备与数据获取
工欲善其事,必先利其器。我们需要准备以下R包:
install.packages(c("tidyverse", "survey", "haven", "srvyr", "gtsummary"))
library(tidyverse)
library(survey)
library(haven)
library(srvyr)
library(gtsummary)
NHANES数据可以直接从CDC官网下载,但更高效的方式是使用R自动获取。以下代码演示如何获取2017-2018周期的 demographics 和 diabetes 数据:
demo_url <- "https://wwwn.cdc.gov/Nchs/Nhanes/2017-2018/DEMO_J.XPT"
diab_url <- "https://wwwn.cdc.gov/Nchs/Nhanes/2017-2018/DIQ_J.XPT"
demo_data <- read_xpt(demo_url) %>%
select(SEQN, RIAGENDR, RIDAGEYR, RIDRETH3, SDMVPSU, SDMVSTRA, WTINT2YR)
diab_data <- read_xpt(diab_url) %>%
select(SEQN, DIQ010)
提示:WTINT2YR是NHANES的访谈权重,不同周期和数据类型需要使用对应的权重变量。
2. 数据清洗与合并
数据质量决定分析结果

&spm=1001.2101.3001.5002&articleId=154860219&d=1&t=3&u=2a4b5a23385d42f5b50384aa336c2ed4)
5万+

被折叠的 条评论
为什么被折叠?



