12:03官方账号arXiv cs.AI@Halil Burak Noyan该论文提出一种三源权限架构(角色上限、任务上下文分类器、策略组合禁令)实现动态最小权限原则。作者构建了一个包含600个企业任务提示的合成数据集,基于15个权限工具分类法标记,经人工验证达到Cohen's κ=0.967。迭代开发将授权违规从46次降至3次(降幅93%)。数据集和生成管线已开源。论文AI agentsLLM权限管理推荐理由:想给企业AI智能体设权限?这篇论文建了个600条数据的合成集和三源架构,把授权违规从46砍到3次,还开源了代码。别错过。原文稍后读已读值得跟进有用关注 AI agents
11:49官方账号arXiv cs.AI@Pouria Mahdi, Haq Nawaz Malik波斯语虽然被超过1.1亿人使用,但其OCR技术远落后于拉丁语系语言,原因是文字复杂且缺乏大规模标注数据。Persian Pixel数据集包含343,000多张高保真图像-文本对,来自精心筛选的700万波斯词语料库。生成管道SynthOCR-Gen模拟了波斯文字连写、字形变体、变音符号等特征,并加入25种以上随机退化模型(如墨迹扩散、纸张老化、模糊等)。该数据集可用于训练TrOCR、Donut等基于Transformer的OCR模型,为低资源复杂文字OCR提供可扩展的合成数据方案。论文Persian PixelOCR波斯语推荐理由:做波斯语OCR不用愁数据了,Persian Pixel有34万张合成图加上25种真实退化模拟,直接拿它训模型比手动标注省事得多。原文稍后读已读值得跟进有用关注 Persian Pixel