日志标准定义事实如何标准化:某主体,经载体,对客体做了一次行为,发生在某切面里,被某观察者记录(event_kind=behavior)。
告警标准定义检出、研判与处置:瘦主表 + 分层子表。
事实只有一份,告警域只引用、不复制。
面向安全运营的开源数据标准:事件事实标准(log-model)回答发生了什么, 告警运营标准(alert-model)回答检出之后怎么研判、怎么流转。 逻辑模型只定义字段语义与对象关系,不绑定存储引擎;参考实现基于 Apache Doris 宽表投影与 Kafka 接入总线。
契约、DDL 与生成器即代码:schema 变更走注册表评审与版本策略,不靠口头约定。
新厂商按「raw-log → wpl-output → platform-context → expected-sdm-event」四件套交付映射,样例即验收。
每条结论可展开证据引用链,可回放、可追责;事实不被分析改写。
标量投影加速检索,VARIANT 权威对象保完整语义;倒排索引与 Bloom 过滤随 DDL 就位。
四个安全数据平台的常见困境,每一条都对应一条明确的设计决策。
14 家厂商、98 类日志各有字段与枚举,检测规则写一份只能用一处。
Dayu-SDM:统一事件表收口——WPL 逐类型解析、OML 标准化组合,映射样例随标准交付;接新厂商只需新增映射,不改下游。
看接入实例 →检测声明混进行为事实,研判时无从区分「观察到的」与「设备声称的」。
Dayu-SDM:观察断言独立于事实层——observation.assertion 保真保存设备判断,但不改写 subject / object / facets 的客观事实,真伪由下游研判。
看主体与客体 →单表几百列:证据、实体、研判、工单混在一起;AI 结论覆盖式写回,无法追责。
Dayu-SDM:瘦主表 + 分层子表——分析只追加、引用逐条落 citation;正式 verdict 仅人工或带 policy_id 的策略回写。
看告警标准 →行业 schema 能分类、能交换,但不规定实体归并、调查索引和告警生命周期。全面改用则丢失运营语义;完全自研则对接成本高。
Dayu-SDM:分层——对外走交换投影,对内用五角色、实体索引与告警对象;一份源映射同时产出内部与交换两套投影。
看核心优势 →各自独立成文、互以对方为边界:日志标准不含研判语义,告警标准不复制日志正文。
一张表装所有厂商、所有类型的安全事件。设备检测判断保存在 observation.assertion,与客观行为事实分离。
回答:发生了什么。认识地位分层:事实只有一份,判断永远归属观察层、锚定证据链。
事实、检出、证据、实体、研判、案件、流转各归其位;AI 结论可解释、可追溯,且不可直接生效。
回答:检出之后谁来处理、结论凭什么可信。
四个词最容易混:事实、声明、检出、工作对象。两套标准共用下面这套边界。
sdm_event:发生了什么行为。subject / object / carriers / facets 描述客观行为——不真不假,只是发生了,是唯一权威的一份。
observation.assertion:观察者对事实的定性——可能错。误报的本质是观察者判断错了,不是事实错了;每个判断经 evidence_refs 回溯到事实。
sdm_alert:哪条检测认为值得看。来源投影或本地检测两条路径统一写入。
sdm_case:谁来处理这组告警。默认调查案件,升级才是正式安全事件。
event_domain='threat' / 来源侧声称是告警,不等于平台 sdm_alert。
是否成为告警取决于两条生成路径之一被执行。
告警域各表只按 event_id / log_id 引用事实;完整 facets 与日志原文留在 sdm_event,按需回查。
交换与分类停在「把多厂商日志说成同一种话」。Dayu-SDM 把这句话接进 SOC。
同一套行为句式做调查,独立对象做告警运营,实体可归并可走时间线。
「这个用户过去 24 小时做过什么」不必按事件类各记一套字段地图。五角色先回答「谁通过什么对谁做了什么」,时间线、行为链与调查跳转走同一套查询。
查询与检测规则写一份,跨类型直接生效;AI 不必为每类日志重学字段地图。
source → carrier → target设备声称检测到什么,保真存放为独立声明层,不改写行为事实;检出做聚合、去重与分派,案件承载研判处置,升级才是正式安全事件。
误报与事实可区分,研判和 AI 拿到的始终是「发生了什么」。
sdm_event / observation.assertion / sdm_alert / sdm_case同一设备跨厂商得到同一个 ID。稳定 entity_id、角色 posting 与倒排索引,让调查从账号跳到设备、从进程跳到域名。
一跳拿到实体全时间线——AI 与分析师找数据,从翻日志变成跳实体。
entity_id · posting · S4 倒排索引标量列加速过滤与聚合,VARIANT 保存完整对象,原文进独立 raw_log 与事件 1:1 回查;投影可以有损,语义对象不可。
查得快、语义全、可回原文对账,查询成本有 Benchmark 验收。
标量列 · VARIANT · raw_log 1:1标准字典之外的字段进 extensions 兼容容器,映射状态区分完整 / 部分 / 未映射,标准路径给查询与关联。
标准外的上下文不流失,检测、狩猎与 AI 敢依赖。
extensions · 映射状态分析是一行只追加、可重跑的记录,引用逐条落 citation;verdict 仅由人或带 policy_id 的策略回写。
AI 结论可审计、可追责,才敢真正进研判流。
append-only · citation · policy_id分层,而不是替代或封闭。交换与行业分类走投影;事件调查、实体归并、物理查询与告警生命周期留在 SDM。不把外部 schema 当作内部唯一模型,也不把分析能力建在某一家平台的字段体系上。
两套标准各自的权威文档入口。