活动

[CSSL@研讨会] 敏感性与大规模文本分析中的小型语言模型:从 130 万份儿童福利叙事记录汲取的经验与启示

分享
列印
日期:

2026年9月18日

時間:

下午3时⾄4时半 (UTC+8, 香港时间)

地點:

香港中文大学信和楼4楼422室

講者:

Brian Perron 教授

美国密歇根大学社会工作学院教授及

儿童与⻘少年数据实验室联合主任

講者簡歷:

Brian Perron 是美国密歇根大学社会工作学院教授,及儿童与青少年数据实验室联合主任。他的研究将自然语言处理及小型开放权重语言模型应用于儿童福利行政纪录和科学计量学语料库,强调发展兼顾资料私隐保护与研究可重现性的社会科学文本分析方法。

報名:
查詢:
講座摘要:

敏感且庞大的文本数据集为计算社会科学带来实务上的挑战:机密纪录无法传送至商业语言模型服务,而依 Token 用量计费的机制,也使得针对超大型语料库的重复分析变得难以负担。能够在单一工作站上执行的小型开放权重语言模型同时解决了这两大限制——不仅能确保文本留存于本地、固定模型版本以保障可重复性,还消除了处理额外文档的边际成本。

本次讲座结合Brian PERRON教授近期的研究工作,包括分析超过 130 万份儿童保护服务调查叙事记录,以及探讨社会工作学术期刊与会议摘要的科学计量学语料库,藉此分享研究人员在开始使用这类模型时的实务经验与心得。

備註:

本次讲座将会进行网上直播 (https://linktr.ee/cssl.cuhk)