星火燎原:从零锻造SparkDeep的极简主义AI之旅

星火工作室 Logo

星火工作室 · 2026年8月


写在前面

三天前,我们做了一个在很多人看来不太理智的决定:从零开始,训练一个属于我们自己的大语言模型。

不是基于Llama微调,不是套壳ChatGPT,而是从模型架构、分词器、训练数据到优化器,全部亲手搭建。

这个决定意味着什么?意味着没有现成的checkpoint可以复用,没有开源模型可以"继承"。意味着每一层网络都要自己写,每一个token都要自己分,每一份训练数据都要自己清洗。

但我们也知道,这意味着真正的自由

今天,我们想和大家分享这个故事的起点——SparkDeep,星火工作室从零开发并训练的Spark系列基座模型。


为什么还要从零训练?

2026年,开源大模型已经遍地都是。Llama、Qwen、DeepSeek……选择一个优秀的基座进行微调,似乎是更"聪明"的选择。为什么不呢?

答案很简单:我们想真正理解这件事。

微调就像是站在巨人的肩膀上。但如果你想成为那个巨人呢?想理解模型的每一处细节,从梯度流动到注意力分布,从分词器词表到损失曲线——唯一的办法,就是亲手走一遍完整的路。

从零训练,不是为了证明我们比别人厉害,而是为了把知识的边界推到我们自己的脚下

另一个原因更实际:我们想做的是一个轻量、高效、可移植的模型。0.2B的参数规模,意味着它可以在CPU上流畅推理,可以在资源受限的场景中落地,可以真正被用起来,而不是被锁在昂贵的GPU集群里。


它是什么?一个200M参数的"小"模型

SparkDeep是一个参数量约2亿的GPT风格解码器模型。放在今天的大模型生态里,这确实算"小"。但"小"有小的好处:

  • 它可以在普通笔记本的CPU上运行
  • 它的推理速度足够快,适合实时对话场景
  • 它的内存占用极低,部署成本几乎可以忽略不计

更重要的是,虽然规模不大,但它的设计并不简陋。

架构亮点:采用了RoPE旋转位置编码、RMSNorm、GELU激活函数,以及权重共享(Token Embedding与LM Head共享参数)——这些都是当前最先进模型(如LLaMA系列)所采用的技术方案。我们没有因为模型小就在架构上妥协。


身份认知:让模型"认识自己"

这是SparkDeep最独特的设计之一。

很多开源模型在被问及"你是谁"时,会回答"我是ChatGPT"或"我是由OpenAI开发的"——这是微调数据中身份信息不明确导致的"幻觉"。

我们从一开始就特别重视这个问题。在训练数据中,我们注入了64组身份问答对,涵盖各种不同的问法:

  • "你是谁?" → "我是SparkDeep,由星火工作室从零开发并训练的Spark系列基座模型。"
  • "你是GPT吗?" → "不是,我是SparkDeep,由星火工作室从零开发并训练的Spark系列基座模型。"
  • "谁开发了你?" → "我是由星火工作室开发并训练的……"

这些身份数据在训练中被重复了8次,确保模型在任何变体的提问下都能准确地"认识自己"。这不是一个简单的"系统提示词"能解决的问题,而是需要在训练过程中把身份认知刻进模型的权重里


精简的分词器:8192词表的考量

另一个有意思的设计是词表大小:8192

相比许多模型动辄3万、5万甚至10万的词表,8192显得格外克制。但这个选择是有意为之的:

  1. Byte-Level BPE:通过字节级的分词方式,即使词表不大,也能覆盖几乎所有中文和英文字符组合。
  2. 轻量部署:更小的词表意味着更小的嵌入层(Embedding Layer),这对模型的整体参数量和推理速度都有正面影响。
  3. 训练效率:在小规模训练中,过大的词表反而会分散模型的注意力,适度的词表更有利于收敛。

分词器的训练同样是从零开始的——我们采集了所有训练数据中的文本,训练了一个专属的BPE分词器,而不是复用任何现成的tokenizer。


数据准备:注入SparkDeep的"灵魂"

训练数据的设计同样体现了一种"克制与精准"的思路。

我们使用的数据主要包括两部分:

第一部分:对话数据
使用了数万条真实的情感对话数据,涵盖用户提问和对应的助手回复。这些数据经过清洗和格式化,被转换为统一的对话模板:

  • 系统提示词(注入SparkDeep的身份和性格)
  • 用户输入
  • 助手回复

第二部分:身份数据(64条 × 8次重复)
就是前面提到的64组身份问答对。每条数据都被完整地编码为对话格式,并重复8次,确保模型在任何时候都不会"忘记"自己是谁。

这种设计的核心思想是:让模型在学会对话的同时,始终记得自己的身份。


训练哲学:极简、高效、透明

SparkDeep的训练过程同样延续了这种极简风格。

优化器:我们选择了Lion优化器,而不是主流的AdamW。Lion只存储一阶动量,内存占用远低于AdamW。对于资源有限的环境来说,这个选择直接决定了训练能否进行。

硬件条件:整个训练在3核CPU、5.8GB内存的环境下完成,总耗时约100分钟。这个训练成本对大多数个人开发者来说都是可以接受的。

可复现性:我们不希望这个项目只是一个"黑盒"。所有的代码、配置、数据准备流程都是开源的,任何人都可以复现这个过程。


当前进度与后续计划

目前,SparkDeep已进入Demo预览阶段。

模型的初步训练已经完成,具备基础的对话能力和身份认知能力。你可以通过generate.py脚本与它进行交互对话,或通过单次提问测试它的回复质量。

需要说明的是: 目前的版本属于"拟合未完成"的预览状态。我们正在进行更充分的训练迭代,以确保模型的稳定性、泛化能力和情感理解深度达到预期水平。

正式版本预计将在3至4周后发布。

在正式版中,我们将完成:

  • 更充分的训练步数,进一步提升模型表现
  • 更完善的情感理解与共情能力
  • 更稳定的推理性能
  • 更丰富的使用文档和示例

如果你想提前体验,现在已经可以下载Demo版本进行测试。我们非常期待听到你的反馈。


写在最后

SparkDeep不是一个试图"超越 GPT-5.6"的模型。它不会写诗让你落泪,不会编程让你失业,也不会在基准测试中屠榜。

但它代表了一件事:在AI大模型时代,创造的门槛并没有人们想象的那么高。

你不需要几百张GPU,不需要几亿资金,不需要一个庞大的团队。你只需要:

  • 一个清晰的想法
  • 一些公开的数据
  • 一份扎实的代码
  • 和足够的耐心

SparkDeep就是这种"小而美"精神的产物。它不追求最大、最强,而是追求最纯粹、最透明、最可理解

我们相信,只有当更多人能够亲手创造AI时,AI才能真正造福更多人。


关于星火工作室

星火工作室是一个由AI爱好者和工程师组成的小团队。我们相信技术应当服务于人,AI不应只是少数巨头的游戏。

我们选择从零开发,选择开放源代码,选择分享每一个技术细节。因为我们相信:

AI打造世界,世界拥抱AI。

欢迎通过以下方式联系我们:


星火工作室 · Spark Studio · Boli AI
AI 拥抱世界,世界信任 AI

标签: Ai训练, 数据

添加新评论