微信扫码
添加专属顾问
 
                        我要投稿
IBM最新力作,文档AI领域的重大突破。 核心内容: 1. SmolDocling模型:基于Hugging Face的SmolVLM-256M构建,参数数量大幅减少 2. 处理多种文档类型:包括商业文件、学术论文等,准确复现文档元素 3. 新型DocTags格式:结构化词汇表和规则,清晰区分文本内容和文档结构
 
                                SmolDocling基于 Hugging Face 的 SmolVLM-256M 构建,该模型在参数数量上比同类文档理解任务调整的视觉-语言模型小 5 到 10 倍。
假设有一个包含文本、表格和图表的文档页面图像,SmolDocling 将该图像转换为 DocTags 序列。
例如,文本内容将被封装在 <text> 标记中,表格结构将使用 OTSL 标记(如 <fcel>、<ecel> 等)表示,图表将被封装在 <picture> 标记中,并可能包含 <caption> 标记以表示图表标题。
DocTags 受 OTSL 启发,定义了一个结构化的词汇表和规则,明确区分文本内容和文档结构,减少了图像到序列模型的混淆。
<loc_x1><loc_y1><loc_x2><loc_y2>。53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2025-10-31
Opera One升级内置AI 迎来智能助手新纪元
2025-10-31
LangExtract——大模型文本提炼工具
2025-10-31
用户测评|DeepSeek-OCR,你用了吗?
2025-10-31
从Palantir智能化技术路线看AI时代企业级架构平台的核心战略位置
2025-10-31
OpenAI 公开 Atlas 架构:为 Agent 重新发明浏览器
2025-10-31
Palantir 本体论模式:重塑企业 AI 应用的 “语义根基” 与产业启示
2025-10-31
树莓派这种“玩具级”设备,真能跑大模型吗?
2025-10-30
Cursor 2.0的一些有趣的新特性
 
            2025-08-21
2025-08-21
2025-08-19
2025-09-16
2025-10-02
2025-09-08
2025-09-17
2025-08-19
2025-09-29
2025-08-20