12:31官方账号arXiv cs.AI@Nicole Mitchell, Dhruv Agarwal, Maty Bohacek, Remi Denton, Roma Patel这篇arXiv论文认为,语言模型拟人化且融入日常使用,可能引发认知、发展和社会情感层面的长期变化。作者主张NLP应转向长期测量用户行为变化,而非局限静态文本评估。论文参考社会科学中纵向数据测量方法,并与NLP计算手段结合。该框架用于在线识别问题行为,并纳入对齐流程以缓解长期风险。论文人机交互AI安全纵向研究推荐理由:一篇讲怎么测AI长期影响的论文,用社会科学的方法补NLP的短板。适合做AI安全和行为研究的人读。原文稍后读已读值得跟进有用关注 人机交互
09:39官方账号arXiv cs.AI@Mack Nixon, Liam Wright, Yevgeniya Kovalchuk, Alison Fang-Wei Wu, Martin Danka, Andy Boyd, David Bann研究者提出开源框架RRBench,评估开源权重LLM驱动的AI代理在纵向人口研究数据准备中的效果。框架包括来自英国队列研究6轮数据的真实清洗脚本,以及20个数据准备任务(创建102个变量)。基准测试显示,31-35B参数模型平均任务完成度达87.9%,接近饱和。结果表明,消费级硬件上的开源模型为治理受限研究中的AI辅助数据准备提供了可行路径。论文open-weight LLMRRBench数据准备推荐理由:想知道开源模型做数据清洗行不行?这篇论文用真实研究数据测试了31-35B模型,近九成任务都能搞定,隐私保护场景也能用。原文稍后读已读值得跟进有用关注 open-weight LLM