语义理解机制
平台内置AI语义层,以业务实体为中心构建知识图谱,通过本体模型定义概念、属性及关系,使业务语义可被系统解析。粒度模型将需求拆解至字段级执行单元,提供从业务语言到技术实现的映射规范。与此相对,常见方式下业务语义的传递依赖人工撰写的文档和口头沟通,解析路径存在不确定性。平台的结构化语义层为后续建模和加工提供了可被校验的输入基础。
天元数据开发平台是一款以AI语义层 + 粒度模型为技术底座,以组件化装载为产品形态,以AI工艺贯穿全流程的新一代数据智能化开发平台。它打破了传统数据平台"工具堆砌"的模式,将AI能力从"外挂插件"升级为"原生基因",实现数据研发从手工作坊到智能流水线的根本性跃迁。
平台的技术架构围绕三大核心支柱构建。[AI语义层]以实体为中心构建多维知识图谱,通过本体模型定义业务领域的核心概念、属性与关系,让机器真正"理解"业务语义。[粒度模型]则将宏观的业务需求拆解到字段级的执行单元,实现从"业务语言"到"技术实现"的精准映射。[组件化装载]将平台能力拆分为基础组件、运维组件、指标组件、标签组件、特征组件、报表组件、加工组件模块,企业可以像搭积木一样按需组合,灵活适配不同场景。
在流程层面,平台创新性地提出了AI工艺理念,将数据开发的全流程抽象为五个智能化阶段:需求智能分析、模型管理、指标拆解、智能加工、AI用数。每个阶段都由AI大模型统一赋能,形成从需求输入到价值输出的完整闭环。这种"AI原生"的设计理念,不是给数据开发加一个AI工具,而是让AI能力长在数据研发的每一步里。
平台围绕数据开发全生命周期,提供从需求解析到数据交付的完整工具链。其价值主要体现在以下几个维度:
平台内置AI语义层,以业务实体为中心构建知识图谱,通过本体模型定义概念、属性及关系,使业务语义可被系统解析。粒度模型将需求拆解至字段级执行单元,提供从业务语言到技术实现的映射规范。与此相对,常见方式下业务语义的传递依赖人工撰写的文档和口头沟通,解析路径存在不确定性。平台的结构化语义层为后续建模和加工提供了可被校验的输入基础。
平台将需求分析、模型管理、指标拆解、数据加工、数据使用等阶段纳入统一流程,各阶段的数据模型、字段映射和血缘关系自动传递,避免因阶段割裂而需手动重新定义或同步。常见开发工具链各环节相对独立,环节间的衔接依赖人工导出导入,平台通过内置流程减少此类重复操作,降低传递中的信息损耗。
平台能力划分为基础、运维、指标、标签、特征、报表、加工等独立组件,企业可按需选装,并支持从单个场景起步,后续按业务发展扩展其他组件。区别于一体化固定边界的套件模式,组件化架构允许增量式扩展,无需一次性加载全部功能。在部署策略上,平台支持与现有基础设施并行运行,不要求整体替换原有系统,可逐步叠加。
在模型生成、SQL编写、指标定义等环节,平台提供自动生成和校验功能,同时保留人工审核与调整入口,所有生成结果、修改记录和审核操作均可追溯。与常见外挂式AI工具不同,平台将AI能力作为内置模块融入开发主流程,而非独立于流程之外的附加功能。内置的过程记录机制支持内部审计和质量管控,不再依赖外部文档记录。
通过元数据管理和字段级血缘追踪,平台提供跨源数据的统一目录和关系视图,便于数据资产的盘点、影响分析和版本管理。资产视图的构建不依赖人工汇总,而是由平台自动采集和更新,减少人工维护成本。
业务人员可通过自然语言查询界面获取数据,无需编写SQL;数据开发人员可使用辅助生成功能;管理员可通过监控中心掌握任务运行状态。各角色在统一平台上协同,操作界面与权限分离,满足不同职能人员的使用习惯和安全要求。
上述设计特点旨在提供区别于传统工具堆砌模式的另一种技术路径。平台的实际适配效果因企业现有数据环境、业务复杂度及实施范围等因素而异,不构成对特定结果或收益的明示或暗示。
天阳科技天元数据开发平台,为商业银行提供数据开发服务,所有场景下的服务均由持牌合作银行独立运营决策,我方仅提供技术工具支撑。
通过部署平台的基础组件、运维组件和指标组件,实现从数据接入到指标输出的全链路标准化管理。AI语义层自动识别业务实体关系,粒度建模将业务需求精准映射到技术实现。
通过组合基础组件、指标组件、标签组件和特征组件,整合分散在多个系统中的客户数据,构建统一的用户画像体系,实现客户标签的智能生成与分层管理。
通过部署全部五大组件,平台覆盖了从需求分析、模型设计、数据加工到报表生成的完整链路。AI用数模块让业务人员可以通过自然语言自主查询数据,提升自助取数效率与报表产出效率,大幅减轻数据团队压力。
某农信银行在面临数据需求爆发式增长与数据开发效率严重不匹配的矛盾,决定引入数据开发平台,打通从需求到用数的全链路:
1. 调研环节:组建联合专家团队驻场三周,精准定位核心痛点:数据口径不一致、数据模型缺乏统一管理、需求到开发的沟通成本过高。并制定分阶段落地计划,首期聚焦信贷业务线的数据开发标准化。
2. 模型环节:借助平台的AI语义层能力,对信贷业务涉及的客户、产品、合同、额度等核心实体进行本体建模,构建了覆盖全业务线的知识图谱。通过粒度建模功能,将原本散落在Excel和文档中的数百个指标定义进行结构化整理。将传统需要6个月的人工梳理工作压缩至2个月,且模型质量显著提升。
3. 开发环节: 基于已构建的语义模型,通过平台进行离线批处理任务的SQL自动生成与调度配置,同时搭建实时流处理管道对接核心业务系统的Kafka数据流。开发周期缩短,代码质量通过自动化检查得到保障。
4. 上线环节:采用组件化架构,根据银行实际需求配置了基础组件、运维组件、指标组件和标签组件的标准化组合。上线前完成全链路回归测试与性能压测,确保高并发场景下的稳定性。上线后,通过平台的作业监控与告警体系,实现任务运行状态的实时可视化管理。
截至目前,该行已实现信贷业务线全部核心指标的自动化开发与统一管控,数据开发整体提效超过70%,指标口径一致性达到100%。
传统数据平台多为"工具堆砌"模式,AI能力以外挂插件形式存在,难以形成有机整体。本平台采用"AI原生"架构,AI语义层和粒度模型作为技术底座贯穿开发全流程,且组件可独立选择部署。
不需要。平台采用组件化装载架构,支持增量叠加式部署。企业可以从最需要的组件开始,逐步扩展。基础组件和运维组件提供数据接入和任务调度能力,可与现有基础设施无缝集成;指标、标签、特征等组件则在现有数据之上提供智能化管理能力,不影响企业既有资产。
平台在AI生成环节设置了质量校验机制。模型生成阶段,AI语义层基于本体模型和粒度模型进行约束,确保输出符合业务语义规范;SQL生成阶段,内置SQL语法校验、性能分析和代码质量检查,自动识别潜在问题。同时,生成结果支持人工审核和调整,操作历史可记录和追溯。
平台通过AI用数模块大幅降低了数据使用门槛。业务人员可以通过自然语言查询数据,无需编写SQL;通过拖拽式设计报表,无需了解底层技术细节。数据开发人员则可以借助AI辅助功能提升效率,将精力聚焦于高价值的业务逻辑设计而非重复性编码工作。
平台支持私有化部署和云原生部署两种模式。私有化部署满足金融、政务等对数据安全要求极高的行业需求;云原生部署则支持容器化、弹性伸缩,适合互联网、零售等快速迭代的业务场景。组件化架构使得部署可以根据企业实际需求灵活裁剪,最小化初始投入。