不只研究“青少年是否使用 AI”:如何设计生成式 AI 与青少年发展研究

2026-09-08 32 预计阅读时间: 1 分钟
来源: openai.com AI 摘要 Original link

Disclaimer: This article is an AI-assisted summary. Read it together with the original source when precision matters. The summary may omit context, version differences, or edge cases and is not official documentation.

预计阅读时间:9 分钟

OpenAI 推出总额 500 万美元的资助计划,支持独立研究团队考察生成式 AI 对青少年发展、福祉与安全的影响。这个议题的难点不在于统计“使用过多少次”,而在于区分不同使用场景、建立可检验的因果假设,并在涉及未成年人时把隐私保护和风险处置写进研究流程。

真正值得测量的是“怎样使用、在什么情境下使用”

把所有生成式 AI 使用归为同一种暴露,很容易得到缺乏解释力的结论。用 AI 检查数学解题步骤、寻求情绪支持、生成社交媒体内容,可能对应完全不同的收益和风险。

一个可执行的研究设计至少应拆分以下维度:

  • 使用目的:学习、创作、娱乐、社交建议或情绪支持。
  • 交互方式:主动提问、被动接受推荐,或者由教师和家长引导使用。
  • 使用强度:频率、单次时长,以及是否发生在深夜等敏感时段。
  • 产品反馈:模型是否表达不确定性,是否建议寻求成年人或专业帮助。
  • 发展阶段:不同年龄段青少年的认知、社交和自我调节能力并不相同。
  • 结果指标:学习表现、睡眠、孤独感、自我效能、风险认知和求助意愿。

比起笼统地问“AI 对青少年有害还是有益”,更可检验的问题是:在相同学习任务中,带有反思提示和使用时限的 AI 辅助方式,是否比无引导使用更能提升自我效能,同时减少依赖?

独立研究需要把安全机制前置

青少年研究不能等到数据收集完毕后再补隐私和伦理说明。可以在方案阶段明确以下边界:

  1. 知情同意与青少年同意:根据研究所在地和参与者年龄,分别处理监护人许可与青少年本人的知情同意。
  2. 最小化采集:如果研究问题只需要交互类别和持续时间,就不应默认保存完整提示词、模型回复或私人对话。
  3. 高风险内容处置:预先定义自伤、虐待、剥削或即时危险信号出现时的人工升级流程,并说明研究保密性的边界。
  4. 独立监督:让伦理审查、统计分析和不良事件判断不依赖产品团队的单方面决定。
  5. 结果完整披露:提前登记主要指标、排除规则和分析计划,避免只发布有利结果。

这里存在真实的权衡:保存完整对话有利于研究语境,却增加敏感信息泄露风险;完全不记录内容更安全,却可能无法判断一次交互究竟是家庭作业辅导还是危机求助。可行的折中方式是优先保存本地生成的类别标签和风险级别,并将原始文本设置为短期、受控、可审计的数据层。

可以这样实践:建立一个最小可复现分析项目

下面的示例不是资助计划的官方模板,也不能替代伦理审查。它演示如何用合成数据比较“有引导”和“无引导”两种 AI 使用条件,并对样本过小的分组停止输出结果。代码只使用 Python 标准库,不接触真实青少年数据。

将以下内容保存为 study_demo.py

import csv
import random
from collections import defaultdict
from statistics import mean

random.seed(7)

# 生成完全虚构的数据,仅用于验证分析流程。
rows = []
for participant_id in range(1, 121):
    age_group = random.choice(['13-15', '16-17'])
    condition = random.choice(['guided', 'unguided'])
    baseline = random.randint(35, 75)

    # 这是人为设定的模拟差异,不是研究结论。
    simulated_change = 4 if condition == 'guided' else 1
    followup = max(0, min(100, baseline + simulated_change + random.randint(-6, 6)))

    rows.append({
        'participant_id': f'P{participant_id:03d}',
        'age_group': age_group,
        'condition': condition,
        'baseline_wellbeing': baseline,
        'followup_wellbeing': followup,
    })

with open('synthetic_teen_ai_study.csv', 'w', newline='', encoding='utf-8') as file:
    writer = csv.DictWriter(file, fieldnames=rows[0].keys())
    writer.writeheader()
    writer.writerows(rows)

# 按年龄段和实验条件计算配对变化。
groups = defaultdict(list)
for row in rows:
    key = (row['age_group'], row['condition'])
    change = row['followup_wellbeing'] - row['baseline_wellbeing']
    groups[key].append(change)

print('age_group,condition,n,mean_change')
for (age_group, condition), changes in sorted(groups.items()):
    # 示例性隐私规则:小样本单元不输出统计值。
    if len(changes) < 10:
        print(f'{age_group},{condition},{len(changes)},SUPPRESSED')
        continue
    print(f'{age_group},{condition},{len(changes)},{mean(changes):.2f}')

运行:

python study_demo.py

脚本会生成一份合成 CSV,并输出各年龄段、各条件下的平均前后变化。把它改造成真实研究项目时,应替换模拟数据生成部分,增加缺失值策略、量表计分规则、置信区间和预注册的统计模型。简单的组间均值不能自动证明因果关系;随机分配、基线平衡、失访分析和干预执行一致性都需要单独检查。

申请和落地时应检查什么

来源信息明确的是:该计划总额为 500 万美元,面向生成式 AI 对青少年发展、福祉和安全影响的独立研究。具体资格、单项额度、截止日期、地域要求和允许支出,应以正式申请材料为准,不宜根据摘要推断。

准备研究方案时,可以用下面的清单做一次内部评审:

  • 研究问题是否具体到使用场景、年龄范围和可测结果?
  • 是否能区分相关性研究、自然实验和随机对照研究所支持的不同结论?
  • 是否纳入青少年、家长、教育工作者和临床或安全专家的意见?
  • 数据方案是否默认最小采集,并明确访问权限、保留周期和删除机制?
  • 是否提前定义严重不良事件、危机信号和强制报告的处理路径?
  • 无论结果正面、负面还是不显著,是否都有公开和复现计划?
  • 研究团队是否能保持方法、分析和发表上的独立性?

优秀的项目不需要预先证明 AI 有益或有害。它更应清楚说明:研究能减少哪一种不确定性,哪些青少年可能受益或受损,以及研究团队将如何在获取答案的同时保护参与者。


相关推荐