RTLCurator: Label-Efficient Data Curation for RTL Generation
RTLCurator 是一种用于 RTL 生成的标签高效数据整理方法。它学习行为感知的兼容性先验,通过对比每个规范与模拟失败的实现,并利用少量验证对校准到新语料库,然后通过平衡对齐、表示覆盖等构建保留子集。在广泛使用的 RTL 数据集中,仅 24.4% 和 53.5% 的配对通过功能测试。
Development
- First ReportRTLCurator: Label-Efficient Data Curation for RTL GenerationarXiv cs.LG
- Current AssessmentRTL 数据稀缺且合成数据质量参差不齐,RTLCurator 提供了一种数据整理方法,可能提高 LLM 生成 RTL 的可靠性。这反映了 AI 辅助硬件设计领域对高质量训练数据的需求。Agent Pulse · analysis
训练大型语言模型编写寄存器传输级(RTL)代码需要大量配对的规范和代码,但此类数据稀缺,大多数公共语料库是合成的。合成提供规模但不保证正确性,在两个广泛使用的 RTL 数据集中,仅 24.4% 和 53.5% 的配对通过生成的功能测试。仅靠正确性过滤会留下短而简单的模块,因为复杂时序设计更难生成和验证。RTLCurator 学习行为感知的兼容性先验,通过对比每个规范与模拟失败的实现,并利用少量验证对校准到新语料库,然后通过平衡对齐、表示覆盖等构建保留子集。
RTLCurator 的核心创新是行为感知的兼容性先验,通过对比规范与失败实现来学习,而非仅依赖正确性。它使用少量验证对进行校准,表明标签效率是关键。这暗示数据整理可以超越二元正确性,捕捉更丰富的语义。
RTL 数据稀缺且合成数据质量参差不齐,RTLCurator 提供了一种数据整理方法,可能提高 LLM 生成 RTL 的可靠性。这反映了 AI 辅助硬件设计领域对高质量训练数据的需求。
对于硬件设计自动化工具,RTLCurator 可能降低数据整理成本,提高 LLM 生成 RTL 的准确性,从而加速芯片设计流程。
未来可验证的信号包括:RTLCurator 在更大规模语料库上的应用,或与其他数据整理方法在 RTL 生成任务上的对比。