我要投稿

Bilibili发布Index-1.9B大模型：没错，就是那个二次元B站

发布日期：2024-06-14 04:44:41 浏览次数： 5293

作者：猜想笔记

微信搜一搜，关注“猜想笔记”

1. **模型简介**：

- Index-1.9B系列是轻量级的语言模型。

- 包含`Index-1.9B base`、`Index-1.9B pure`、`Index-1.9B chat`和`Index-1.9B character`等模型。

- 模型已在HuggingFace和ModelScope上开源。

2. **预训练**：

- 模型在2.8T的数据上训练，涵盖中英文等多种语言。

- 数据经过清洗，包括避免偏置和去重。

- 使用SentencePiece训练BPE Tokenizer，特别针对中文进行了优化。

3. **模型架构**：

- 与主流的Decoder-Only Transformer模型一致，进行了一些调整，如更深的模型层数（36层）和Norm-Head机制。

4. **训练过程**：

- 使用AdamW优化器，两阶段训练策略（Stable和Decay阶段）。

- 训练基建使用了自研训练框架和华为昇腾910B卡。

5. **评测**：

- 使用OpenCompass框架进行评测，包括综合性选择题、理解和推理、数学和代码评测。

6. **讨论和实验**：

- 探讨了模型结构、学习率、预训练中是否加入指令等因素对模型性能的影响。

- 进行了消融实验，分析了不同组件对模型性能的贡献。

7. **对齐**：

- 通过SFT（Supervised Fine-Tuning）和DPO（Direct Preference Optimization）进一步优化模型，以符合人类偏好。

8. **角色扮演**：

- 利用RAG（Retrieval-Augmented Generation）技术，实现few-shot角色扮演定制。

9. **局限性**：

- 尽管采取了合规性检测，但模型可能存在未预料到的问题，使用时需注意潜在风险。

以上由Kimi总结，0 shot。原文档字有点小，凑合看吧。在公众号后台回复“B站”获取原文档。

//

END.

53AI，企业落地大模型首选服务商

产品：场景落地咨询+大模型应用平台+行业解决方案

承诺：免费POC验证，效果达标后再合作。零风险落地应用大模型，已交付160+中大型企业

相关资讯

2026-05-15

谷歌Android重大更新！底层植入Gemini，苹果已掉队

2026-05-15

Codex更新远程控制，你也终于可以在手机上随时随地Vibe Coding了。

2026-05-15

2026年了，我强烈推荐你用一用Codex，功能太全面了！附使用指南

2026-05-14

DAA度量Agent，百度智能云率先重构AI云

2026-05-14

美团 LongCat 开源 General 365：树立推理评测新标尺

2026-05-14

终端里住进了一个叫 Claude Code 的搭档

2026-05-14

小企业专属Claude来了！一键接入全套业务流，不用写代码AI自动算账催款

2026-05-14

开源 ElevenLabs 平替来了！OmniVoice Studio 本地免费实现电影级配音

联系获取

联系获取

160+中大型企业正在使用53AI

立即咨询预约演示

把握AI发展的机遇，共同探索、共同进步

2025-01-22

如何打造基于GenAI的员工服务机器人

2025-01-22

热点资讯

Claude Opus 4.7刚刚曝光！Claude Code一夜重构，7x24小时替你打工

2026-04-15

豆包 2.0 模型发布，全信息整理（全网最完整，另附 79 页 Model Card）

2026-02-14

刚刚Qwen 3.6 Plus上线预览：1M上下文，阿里Coding/Agent翻身战打响

2026-03-31

2026年国内如何注册 Claude 账号教程

2026-03-13

OpenAI Codex CLI 完整使用指南

2026-04-07

独家| DeepSeek-V4终于要来了：梁文锋憋半年大招，多模态+长期记忆全面破局

2026-03-17

香港终于能直接用 Gemini 了，内地用户能用上吗？

2026-03-17

Claude Code 和 Codex 接入 Figma MCP 保姆级教程

2026-04-07

编程选GPT-5.4，还是GPT-5.3-Codex？

2026-03-21

全球首个 AI 进化网络 EvoMap，给 Agent 装上 DNA

2026-02-20

大家都在问

谁来给企业端即将大规模入职的Agent盖办公室？

2026-05-09

鹅厂员工觉得好的code模型应该具备什么能力？

2026-05-09

Markdown要被抛弃了？Claude Code工程师自曝：我已彻底放弃使用Markdown！团队倾向使用HTML！网友：其他编辑工具会被淘汰吗？

2026-05-09

AI吞噬软件的叙事要分化了？

2026-05-08

为什么同一个模型，在 Claude Code/Codex CLI 里感觉像换了个脑子？

2026-05-07

「双线实测」Qwen 3.6-Plus，Agentic Coding 已经这么能「扛活儿」了？

2026-04-26

本体化语义层，会是 AI 数据平台的新地基吗？

2026-04-22

设计行业的“棺材板”，要被Claude Design盖上了？

2026-04-18

热门标签

内容创作大模型技术个人提效 langchain llamaindex 多模态技术 RAG技术智能客服知识图谱模型微调 RAGFlow coze Dify Fastgpt Bisheng Qanything AI+汽车 AI+金融 AI+工业 AI+培训 AI+SaaS Skill 提示词技巧 AI+电商 AI面试数字员工 ChatBI AI知识库开源大模型智能营销智能硬件智能化改造 AI+医疗 MaxKB Palantir Glean Openclaw

应聘简历请发送至： ceo@53ai.com

联系我们

售前咨询

预约演示

微信扫码

添加专属顾问

回到顶部