OpenAI 推出总额 500 万美元的资助计划,支持独立研究团队考察生成式 AI 对青少年发展、福祉与安全的影响。这个议题的难点不在于统计“使用过多少次”,而在于区分不同使用场景、建立可检验的因果假设,并在涉及未成年人时把隐私保护和风险处置写进研究流程。
真正值得测量的是“怎样使用、在什么情境下使用”
把所有生成式 AI 使用归为同一种暴露,很容易得到缺乏解释力的结论。用 AI 检查数学解题步骤、寻求情绪支持、生成社交媒体内容,可能对应完全不同的收益和风险。
一个可执行的研究设计至少应拆分以下维度:
- 使用目的:学习、创作、娱乐、社交建议或情绪支持。
- 交互方式:主动提问、被动接受推荐,或者由教师和家长引导使用。
- 使用强度:频率、单次时长,以及是否发生在深夜等敏感时段。
- 产品反馈:模型是否表达不确定性,是否建议寻求成年人或专业帮助。
- 发展阶段:不同年龄段青少年的认知、社交和自我调节能力并不相同。
- 结果指标:学习表现、睡眠、孤独感、自我效能、风险认知和求助意愿。
比起笼统地问“AI 对青少年有害还是有益”,更可检验的问题是:在相同学习任务中,带有反思提示和使用时限的 AI 辅助方式,是否比无引导使用更能提升自我效能,同时减少依赖?
独立研究需要把安全机制前置
青少年研究不能等到数据收集完毕后再补隐私和伦理说明。可以在方案阶段明确以下边界:
- 知情同意与青少年同意:根据研究所在地和参与者年龄,分别处理监护人许可与青少年本人的知情同意。
- 最小化采集:如果研究问题只需要交互类别和持续时间,就不应默认保存完整提示词、模型回复或私人对话。
- 高风险内容处置:预先定义自伤、虐待、剥削或即时危险信号出现时的人工升级流程,并说明研究保密性的边界。
- 独立监督:让伦理审查、统计分析和不良事件判断不依赖产品团队的单方面决定。
- 结果完整披露:提前登记主要指标、排除规则和分析计划,避免只发布有利结果。
这里存在真实的权衡:保存完整对话有利于研究语境,却增加敏感信息泄露风险;完全不记录内容更安全,却可能无法判断一次交互究竟是家庭作业辅导还是危机求助。可行的折中方式是优先保存本地生成的类别标签和风险级别,并将原始文本设置为短期、受控、可审计的数据层。
可以这样实践:建立一个最小可复现分析项目
下面的示例不是资助计划的官方模板,也不能替代伦理审查。它演示如何用合成数据比较“有引导”和“无引导”两种 AI 使用条件,并对样本过小的分组停止输出结果。代码只使用 Python 标准库,不接触真实青少年数据。
将以下内容保存为 study_demo.py:
import csv
import random
from collections import defaultdict
from statistics import mean
random.seed(7)
# 生成完全虚构的数据,仅用于验证分析流程。
rows = []
for participant_id in range(1, 121):
age_group = random.choice(['13-15', '16-17'])
condition = random.choice(['guided', 'unguided'])
baseline = random.randint(35, 75)
# 这是人为设定的模拟差异,不是研究结论。
simulated_change = 4 if condition == 'guided' else 1
followup = max(0, min(100, baseline + simulated_change + random.randint(-6, 6)))
rows.append({
'participant_id': f'P{participant_id:03d}',
'age_group': age_group,
'condition': condition,
'baseline_wellbeing': baseline,
'followup_wellbeing': followup,
})
with open('synthetic_teen_ai_study.csv', 'w', newline='', encoding='utf-8') as file:
writer = csv.DictWriter(file, fieldnames=rows[0].keys())
writer.writeheader()
writer.writerows(rows)
# 按年龄段和实验条件计算配对变化。
groups = defaultdict(list)
for row in rows:
key = (row['age_group'], row['condition'])
change = row['followup_wellbeing'] - row['baseline_wellbeing']
groups[key].append(change)
print('age_group,condition,n,mean_change')
for (age_group, condition), changes in sorted(groups.items()):
# 示例性隐私规则:小样本单元不输出统计值。
if len(changes) < 10:
print(f'{age_group},{condition},{len(changes)},SUPPRESSED')
continue
print(f'{age_group},{condition},{len(changes)},{mean(changes):.2f}')
运行:
python study_demo.py
脚本会生成一份合成 CSV,并输出各年龄段、各条件下的平均前后变化。把它改造成真实研究项目时,应替换模拟数据生成部分,增加缺失值策略、量表计分规则、置信区间和预注册的统计模型。简单的组间均值不能自动证明因果关系;随机分配、基线平衡、失访分析和干预执行一致性都需要单独检查。
申请和落地时应检查什么
来源信息明确的是:该计划总额为 500 万美元,面向生成式 AI 对青少年发展、福祉和安全影响的独立研究。具体资格、单项额度、截止日期、地域要求和允许支出,应以正式申请材料为准,不宜根据摘要推断。
准备研究方案时,可以用下面的清单做一次内部评审:
- 研究问题是否具体到使用场景、年龄范围和可测结果?
- 是否能区分相关性研究、自然实验和随机对照研究所支持的不同结论?
- 是否纳入青少年、家长、教育工作者和临床或安全专家的意见?
- 数据方案是否默认最小采集,并明确访问权限、保留周期和删除机制?
- 是否提前定义严重不良事件、危机信号和强制报告的处理路径?
- 无论结果正面、负面还是不显著,是否都有公开和复现计划?
- 研究团队是否能保持方法、分析和发表上的独立性?
优秀的项目不需要预先证明 AI 有益或有害。它更应清楚说明:研究能减少哪一种不确定性,哪些青少年可能受益或受损,以及研究团队将如何在获取答案的同时保护参与者。