MentalChat16K
包含 16K 条心理咨询对话的基准数据集,将覆盖 33 个心理健康主题的 GPT 生成多轮对话,与来自真实行为干预访谈的问答对相结合,用于对话式心理健康模型的训练与评测。基于其微调的开源模型(LLaMA-2、Mistral、Vicuna、Zephyr)由人类专家与 LLM 评审在七个维度上共同评估;目前已是 Hugging Face 上下载量最高的心理健康数据集之一。
按研究领域组织的科研与应用项目,并列出相应论文的研究课题。
大语言模型的基准构建、指令微调与严谨评估,聚焦对话式心理健康支持。
包含 16K 条心理咨询对话的基准数据集,将覆盖 33 个心理健康主题的 GPT 生成多轮对话,与来自真实行为干预访谈的问答对相结合,用于对话式心理健康模型的训练与评测。基于其微调的开源模型(LLaMA-2、Mistral、Vicuna、Zephyr)由人类专家与 LLM 评审在七个维度上共同评估;目前已是 Hugging Face 上下载量最高的心理健康数据集之一。
基于 MentalChat16K 微调的大语言模型系统,在 7 项心理健康指标上超越基座模型与基线,由人类专家与 LLM 评审(GPT-3.5、Gemini Pro)共同评估。
为动机式访谈提供 AI 即时反馈:Whisper 转写与说话人分离,Gemini 按 MITI 金标准编码体系自动评分,给咨询师结构化的改进建议。项目面向全球成瘾治疗的可及性缺口(3950 万患者中仅 20% 获得治疗)。
面向异构临床影像来源的疾病检测与图像分析:深度学习与集成方法。
注意力增强的集成学习方法,在异构眼底图像来源间实现可转诊糖尿病视网膜病变的稳健检测,发表于第 55 届 ARVO 年会。
基于 MRI 数据构建分类器,在横断面与纵向队列中预测痴呆的发展。
使用开源 BrainSuite 工具包对人脑 MRI 进行自动化处理:表面提取、配准与分析。
在人群队列上运用因果推断、中介分析与机器学习量化生物学衰老与神经退行,并构建支持健康长寿的信息学工具。
通过文本挖掘构建阿尔茨海默病研究门户,为健康老龄化的技术识别提供知识库。
面向中国 7 万亿元养老产业的双市场增长战略:AI 驱动的金融规划与个性化照护,目标三年收支平衡、90%+ 入住率。
运用地理空间与计算社会科学方法研究健康公平、环境暴露与公共话语。
在 Google Cloud 上构建多源政治数据管线:微调 Whisper 处理西语政治演讲,分析 10 万+ 篇新闻以量化查韦斯时代的舆论情感变迁。宾大、哥伦比亚与伯克利联合项目。
对印度空气污染的大数据分析,获宾大 CIS 545 大数据分析课程最佳可视化奖。