AiNews
⚡ 速览 🧠 模型
← 返回首页

#digitization

包含标签 "digitization" 的文章,共 2 篇。

🧠 模型动态 Hacker News

拆古籍喂AI:一名扫描销毁员的工作自白

Hacker News 上的一篇热帖引发关注:一名一线从业者透露,他所在的公司为了采集 AI 预训练数据,在对古籍进行高分辨率扫描后,会将实体书物理销毁。随着大模型对高质量文本数据的需求激增,部分数据服务商采用切脊扫描等高效手段来提升吞吐量,随后直接废弃纸质原件。这种破坏性的数据获取模式,折射出大模型研发中追求数据规模与保存历史文献之间的现实矛盾。这不仅揭示了 AI 数据工程流水线中冷酷的一面,也给行业带来关于数据来源合规性与文化遗产保护的深层思考。

🎁 羊毛福利 Reddit

十年PS人工数据如何自动化图书数字化

巴基斯坦民间数字图书馆 Ibteda Digital Library 将十年间手工处理 1765 本稀有乌尔都语图书积累的 57.5 万个 PS 裁剪标签,成功转化为自动化图书数字化的监督训练数据。项目通过 SIFT 和 MAGSAC 算法将成品页面与原始照片进行配对,恢复了几何裁剪关系。实践发现,盲目堆砌数据量、采用 ResNet-50 等复杂模型或提高图像分辨率均告失败,反而是基于人工经验提取的高质量监督数据效果更好。该案例验证了将长期积累的领域工作流沉淀为监督学习信号的可行性,为中小规模档案数字化提供了务实的工程路径。