BigSocialBoss

面向 Code LLM 的训练数据

代码智能修复与大模型训练数据集

为代码大模型的预训练与微调,提供可训练、可评测的代码数据:缺陷定位与类型分类、修复前后对照、多语言代码对,以及注释与文档生成标注。帮助模型更好地理解代码、改对代码、写清说明。

vite.config.ts 改前与改后:统一 React 实例

你们可能正在遇到

模型会补全,却经常改不对、说不清

能生成,不能稳定修 Bug

补全流畅,真正定位缺陷、给出可编译修复时却不稳。缺的是带位置和类型的缺陷样本,而不是再堆公开仓库。

修了这一处,坏了另一处

没有「改前 / 改后」成对数据,模型学不到最小必要改动。需要同一问题的对照对,并写清为什么这样改。

语言一换就掉队

Python 还行,Java、C++、Go 或前端栈明显变差。需要跨语言、同一任务口径的代码对,而不是单一语言爬虫。

代码能跑,文档对不上

注释过时、函数说明像口号。需要「代码 ↔ 注释 / 文档」对齐标注,才能训文档生成和解释能力。

核心能力

四类数据,对应 Code LLM 最缺的能力

代码缺陷标注

在真实或授权仓库中定位 Bug:出错文件、行区间、触发条件。按类型分类(空指针、越界、并发、资源泄漏、错误处理、安全注入等),并附简短复现说明。模型先学会「错在哪」,再谈「怎么改」。

Bug 定位 · 类型分类

修复逻辑梳理

同一问题给出 Before / After 代码对:改动尽量小、可编译或可运行。附修复意图(为何改、改了哪条约束、有没有测试)。避免「整段重写」式噪音,让微调学到可复用的修补模式。

Before / After 代码对

多语言代码对构建

按任务对齐多种实现:Python、Java、C/C++、Go、JavaScript/TypeScript 等。可以是「同一算法不同语言」,也可以是「同一缺陷在不同语言里的修复」。字段写清语言、版本与依赖,避免把不可运行片段当训练正例。

Python · Java · C++ 等

注释与文档生成标注

为函数、模块、API 配上与代码一致的注释、参数说明、返回值与例外。可做「缺文档的代码 → 应写文档」对,也可做「过时注释 → 更正后注释」对,专门训解释与文档生成,而不是空喊「会写 README」。

注释 · 文档 · 解释

缺陷定位:入口与创作区各加载一份 React,导致 removeChild
修复对照:出图从写死自动改为按所选模型传参
待配图 · 多语言代码对 建议:同一函数的 Python / Java / C++ 三栏
待配图 · 注释与文档 建议:函数签名 + 生成的 docstring / API 说明并排

为什么选我们

按工程规范做数据,而不是堆公开仓库

先对齐口径再扩产

缺陷类型、语言范围、能否运行、要不要测试,都在试标里锁死。通过后再按批次生产,避免标了一堆却训不进去。

懂代码的人盯指南

缺陷分类和修复对需要读得懂上下文。标注与抽检分岗,争议样本升级,不把「能编译」当成唯一标准。

可抽检、写出仓说明

语言分布、缺陷类型占比、修复对是否可运行,写入交付说明。未达约定门槛的批次不出仓。质检流程与视频数据共用同一套关口,见质量保障

授权与脱敏

只用客户授权代码、自有习题或合同允许的开源许可范围。可按约定去掉仓库名、账号与内部域名。加密交到你们指定存储。

合作流程

从需求沟通到数据交付

1. 需求沟通

模型用途(补全 / 修复 / 文档)、语言、缺陷类型、规模(条数或仓库数)。

2. 试标验证

一小批金标:缺陷怎么标、修复对怎样算合格。

3. 批量生产

按冻结指南生产四类数据,自动规则拦空标签、语言字段错误。

4. 质量验收

抽检可运行性、类型一致性、文档是否与代码对齐。

5. 数据交付

JSONL / 仓库切片 + 字段说明 + 覆盖统计,加密传输。

项目类型(脱敏)

这类数据通常用在哪里

公开页不写客户真名。下列为典型用途,细节咨询时说明。

代码修复微调

给已有 Code LLM 补「缺陷 → 最小修复」对,提升修 Bug 与改测试的成功率,减少整段胡乱重写。

构建配置修复:dedupe 与 optimizeDeps 锁定同一套 React

多语言与文档能力

同一任务跨语言实现,或给内部 API 生成与代码一致的注释、手册片段,供企业私有模型使用。

待配图 · 文档生成示意 可放脱敏 API 页与源码对照

你们会收到什么

代码 + 标注 + 说明,一套齐

包含内容说明
源码切片按约定语言与许可范围;可附最小可运行上下文
缺陷与修复标注位置、类型、Before/After、修复意图;需要时含测试
多语言 / 文档对语言字段、对齐任务 ID、注释与文档文本
项目说明各类型条数、语言占比、抽检结果
交付方式加密传到你们指定存储,不用公开网盘默认链接

实战案例

代码修复数据集 — React 双重渲染冲突排查

一份完整封存的修复样本:需求、红屏报错、定位、构建层修复,以及改前 / 改后代码。可下载 JSON,用于评测或微调「复杂环境怎么改对」。

已修复 React + Vite 构建环境冲突 CODEREPAIR

业务场景

独立站创作区要加「多模型选图」:在需求描述下方选出图模型,并支持图片单张删除与清空。

遇到的困难

功能代码已经写上,底部也能看到模型选项,但整页被红屏盖住,无法点击。报错是 NotFoundError: Failed to execute 'removeChild' on 'Node'——节点不属于当前 React 树,典型双重实例冲突,而不是选图逻辑写错。

我们如何解决

顺着构建链路查,发现入口与创作区各加载了一份 React。在 vite.config.ts 里用 resolve.dedupe 强制同一份 React,并配合 optimizeDeps 预构建依赖,从根上消掉 DOM 归属冲突。

最终成果

红屏消失。模型选择、出图、单张删除与清空均可操作。需求 → 报错 → 定位 → 修复整条链路已打成数据包(含改前 / 改后切片与结论)。

这个案例说明什么

代码训练数据不只是函数级补丁。环境冲突、双重运行时、构建配置这类「功能看起来写对了、页面却挂了」的样本,对 Code LLM 同样值钱——模型要学会改对构建,而不只是改一行业务代码。

修复前:创作区被 removeChild 红屏遮挡
修复前 · 红屏遮挡,无法交互
数据脱敏 修复后:创作区正常可用,画面已数据脱敏
修复后 · 功能可用 · 数据脱敏

问询

咨询代码数据方案

请写明模型用途(修复 / 补全 / 文档)、语言、大概规模。报价按范围确认,本页不标价。