微信扫码
添加专属顾问
我要投稿
IBM最新力作,文档AI领域的重大突破。 核心内容: 1. SmolDocling模型:基于Hugging Face的SmolVLM-256M构建,参数数量大幅减少 2. 处理多种文档类型:包括商业文件、学术论文等,准确复现文档元素 3. 新型DocTags格式:结构化词汇表和规则,清晰区分文本内容和文档结构
SmolDocling基于 Hugging Face 的 SmolVLM-256M 构建,该模型在参数数量上比同类文档理解任务调整的视觉-语言模型小 5 到 10 倍。
假设有一个包含文本、表格和图表的文档页面图像,SmolDocling 将该图像转换为 DocTags 序列。
例如,文本内容将被封装在 <text> 标记中,表格结构将使用 OTSL 标记(如 <fcel>、<ecel> 等)表示,图表将被封装在 <picture> 标记中,并可能包含 <caption> 标记以表示图表标题。
DocTags 受 OTSL 启发,定义了一个结构化的词汇表和规则,明确区分文本内容和文档结构,减少了图像到序列模型的混淆。
<loc_x1><loc_y1><loc_x2><loc_y2>。53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2025-12-17
腾讯大模型「变阵」:成立 AI Infra 部,姚顺雨出任首席 AI 科学家
2025-12-17
OpenAI发布了其实时API的新模型
2025-12-17
有人逆向拆解了ChatGPT 的记忆功能
2025-12-17
智能体协同落地方案探索
2025-12-17
吴恩达最新课程:别再只写Prompt了!掌握Agentic AI,让AI自主工作!
2025-12-17
开发者能用 ChatGPT App 赚钱了|机会,留给晚睡的人
2025-12-17
一位网友逆向破解了 ChatGPT 记忆系统,给我干破防了
2025-12-16
深度研究:我们如何构建水平最先进Agent
2025-09-19
2025-10-26
2025-10-02
2025-09-29
2025-10-07
2025-09-30
2025-11-19
2025-10-20
2025-11-13
2025-10-02
2025-12-16
2025-12-15
2025-12-14
2025-12-12
2025-12-12
2025-12-11
2025-12-09
2025-12-08