ONESTRUCTION 与 AWS GenAIIC 合作,利用合成数据和三阶段训练管道,在数据稀缺的建筑领域成功训练了 Ishigaki-IDS 基础模型。
本文由 ONESTRUCTION, Inc. 与 Amazon Web Services Japan G.K. 联合撰写,作为 GENIAC(生成式 AI 加速器挑战赛)第三阶段的一部分,并获得 AWS Generative AI Innovation Center (GenAIIC) 的技术咨询。
在数据稀缺的领域构建领域专用基础模型并非易事。你需要足够的训练数据、专业知识以及验证输出的方法。
ONESTRUCTION, Inc. 是一家通过 openBIM 解决行业问题的建筑科技创业公司。在 GenAIIC 的技术指导下,该公司构建了 Ishigaki-IDS,这是一个专注于建筑行业 BIM(建筑信息模型)工作流的Foundation Model(FM)。BIM 是建筑物物理和功能特征的数字化表示,贯穿建筑全生命周期。
日本建筑行业面临持续的劳动力短缺问题。BIM 在国家层面得到推广,因为它允许设计、施工和维护团队在一个平台上共享信息。但采用 BIM 需要专业知识,而这种学习成本阻碍了其更广泛的应用。IDS(信息交付规范)就是一个很好的例子——这是一种基于 XML 的标准,定义了附加在 BIM 模型(IFC(工业基础类)模型)上并需通过其验证的信息。编写 IDS 文件需要掌握其语法以及对 IFC 及其规则的了解。Ishigaki-IDS 降低了这一门槛,使非 BIM 专业的从业者也能审查和管理属性信息。
本文是关于 ONESTRUCTION 如何构建 Ishigaki-IDS 的架构案例研究。如果你是一名从事领域适配的机器学习(ML)工程师,或者是一名技术领导者,正在权衡如何在数据稀缺的场景下构建专用 AI 模型,你会找到一个可以复用的模式。建筑和 BIM 从业者也能从中看到 AI 在其领域的应用前景。需要具备基础模型训练(预训练和微调)以及基本 AWS 计算概念的了解,但并非必须。
如何利用合成数据生成克服小众领域的数据稀缺问题。
如何构建三阶段训练流水线(CPT、SFT、RLVR)实现领域专精。
如何通过可验证奖励实现结构化输出生成。
如何在 Amazon Elastic Compute Cloud (Amazon EC2) P5en 实例上使用 AWS ParallelCluster 运行分布式训练。
构建 IDS 基础模型的三大挑战
有三个问题横亘在我们和一个可用的 IDS 模型之间。
第一个是数据稀缺。IDS 是一个相对较新的标准,发布于 2024 年,而建筑行业总体上是公共网络内容有限的领域。金融、医疗、法律等其他许多领域的模型都在数十亿到数千亿 token 的语料库上训练,但 IDS 领域不存在可比的公共数据集。即使收集了最新的网络数据,量也很小、深度也不够,这意味着模型无法仅从数据中获取足够的关于 IDS 及相关主题的上下文。
第二个是注入包含数千个术语的 IFC 词汇表。例如,"beam" 映射到 IfcBeam,"air conditioner" 映射到 IfcUnitaryEquipment。这种映射历来由领域专家手工完成,我们需要模型直接学习它。
第三个是 IDS 特有的语法。IDS 不仅仅是普通的 XML:其标签结构会根据附加或验证的信息而变化,作者必须使用重复模式和专用标签。通用基础模型难以准确生成这种结构。
我们的方法结合了三个要素:多阶段训练流水线、与领域专家的紧密协作,以及为稳定分布式训练构建的基础设施。我们先从训练流水线说起。
三阶段训练流水线
我们在 Qwen3(8B / 14B / 32B)之上构建 Ishigaki-IDS。Qwen3 是阿里巴巴云旗下的开源大语言模型(LLM),以强大的多语言能力和广泛的参数规模著称。凭借这一系列参数规模,我们可以在较小的规模上进行实验,再决定是否投入完整的 32B 训练运行。我们采用了三阶段训练流水线。
第一阶段是持续预训练(CPT),我们使用网络语料库以及与内部领域专家共同创建的合成数据来注入 IDS 和 IFC 领域知识。我们大规模生成有效的 IDS 文件,并构建从多个角度解释 IDS 相关文档的合成数据集,合成数据覆盖了大部分训练语料。
第二阶段是监督微调(SFT),我们用 IDS 编写指令(CSV 或自然语言形式)与预期 IDS 输出的配对来训练模型。仅靠 SFT 会留下预期内的问题,例如看似合理但错误的 XML 标签选择以及错误的属性值,因此我们设计了第三阶段来解决这些问题。
第三阶段是带可验证奖励的强化学习(RLVR),我们使用国际标准组织 buildingSMART 的 IDS-Audit-Tool 作为奖励函数。该工具检查 XML 格式良好性、IDS 结构有效性和语义一致性,因此模型可以针对机械正确性信号进行迭代。RLVR 非常适合 IDS 任务,因为它无需大量监督数据就能提升输出质量——这对于数据贫乏的领域非常有用。
GenAIIC 的技术咨询
我们以自己在建筑和 BIM 领域的专业知识主导开发,每两周与 GenAIIC 会面以获取技术咨询。在每个里程碑,我们都会在会议上展示训练结果和评估数据,共同解决了五个关键领域的问题:
训练数据设计——IDS 领域的合成数据策略,以及如何在 CPT、SFT 和 RLVR 阶段之间平衡数据配比。
评估基准——涵盖 IFC 和 IDS 知识、结构化生成以及通用对话能力的指标。
训练阶段和技术——优化 CPT、SFT 和 RLVR,包括长上下文处理、奖励塑形和结构化生成。
训练基础设施——分布式训练的并行化、吞吐量和稳定性。
结果诊断——出现问题时诊断根本原因并为下一次迭代设定方向。
在每个周期中围绕"哪些改变能提升 IDS 生成准确性和实用性"进行迭代,帮助我们在短时间内在一个小众、数据贫乏的领域构建了领域专用基础模型。
在训练基础设施方面,我们使用了 Amazon EC2 P5en 实例(两个配备 NVIDIA H200 Tensor Core GPU 的 p5en.48xlarge 节点),通过 AWS ParallelCluster 进行编排。ParallelCluster 是一个开源工具,简化了 AWS 上高性能计算(HPC)集群的部署和管理。我们将训练数据、合成数据和检查点存储在 Amazon FSx for Lustre 上,这是一个完全托管的文件系统,针对计算密集型工作负载进行了优化,提供亚毫秒级延迟和高吞吐量。这一配置为我们提供了稳定的多节点分布式训练和对大型数据集的并行访问。
我们与内部 IDS 专家一起构建了自己的评估基准 IDS-Bench。IDS-Bench 测量 IFC 版本、建筑学科(建筑、结构、MEP 和通用)、语言(日语和英语)以及 Implement、Structure 和 Content 轴线上的性能,因此分数反映了模型在真实工作中需要处理的内容。
在我们的 IDS-Bench 评估中,Ishigaki-IDS 在 XML 结构合规性和 IDS 结构合规性上得分接近 100%,在 IDS 内容一致性上得分超过 80%。通用前沿模型则呈现不同结果:它们生成的 XML 格式良好,但在 IDS 结构合规性上得分约为 25%,在 IDS 内容一致性上接近 0%。IDS 是一个专业且相对较新的领域,这正是领域专用模型能够解决的问题。该模型还支持通过 YaRN(Yet another RoPE extensioN)进行上下文长度扩展。YaRN 在不出现重大性能下降的情况下将 transformer 模型的上下文窗口扩展到其原始训练长度之外。我们确认模型在输入和输出高达约 120k token 时仍能正确生成。
在与 buildingSMART 的联合概念验证中,IDS 专家和非专家都对在工作流程中使用该模型给予了积极反馈,并对其能够从模糊提示中生成预期 IDS 的能力表示认可。他们还提供了一份进一步开发的建议清单,这加强了我们的观点——该模型在实际应用中是有用的。
从这个项目中得出的三个要点:
合成数据的质量比数量更重要。领域专家参与合成数据创建是决定模型性能的关键因素。仅靠数量无法产生同样的结果。
可验证的奖励加速迭代。使用 IDS-Audit-Tool 作为自动奖励信号使我们能够比人工评估更快地迭代,特别是在数据贫乏的环境中。
稳定的基础设施让我们能够自由实验。在 Amazon EC2 P5en、AWS ParallelCluster 和 Amazon FSx for Lustre 上可靠的分布式训练使我们能够专注于模型改进,而不是调试集群问题。
将领域专家协作、合成数据以及与验证工具挂钩的 RLVR 相结合,在数据贫乏的专业领域构建领域专用模型方面效果良好。GenAIIC 持续的技术咨询帮助我们在 GENIAC 第三阶段的时间范围内达到了 IDS-Bench 上测量的准确率目标。ONESTRUCTION 将继续与 AWS 合作,将 AI 工具引入建筑行业。
如果你对为所在行业构建领域专用基础模型感兴趣,以下资源是很好的起点:
探索 AWS GenAIIC——了解 AWS Generative AI Innovation Center 如何通过技术咨询和最佳实践支持生成式 AI 项目。
开始使用分布式训练——参阅 AWS ParallelCluster 用户指南设置类似的基础设施。
试用 Ishigaki-IDS——在 Hugging Face 上访问该模型并针对你自己的 IDS 场景进行测试。