CORE ALGORITHMS
算法体系
从理论到工程的系统性创新
注意力机制 · GRA
基于Ky Fan分解的几何注意力,在内容基空间中进行注意力计算,实现缓存从nd降到nr
| 分数 | 原公式:MHA / Softmax | 本框架:GRA |
|---|---|---|
| 分数 | s_j = q·k_j / sqrt(d) | s_t = (U^T q)·(U^T k_t) / sqrt(r) − λ·dist |
| 权重 | p = Softmax(s), 全长 n | p = Softmax(s); 对照真理 λ=0 |
| 窗 | 无; 或 keep-k 启发式 | W = ceil(ln(1/θ)/λ) |
| 输出 | y = sum_j p_j v_j | y_α = U sum_t p_t k_r_t |
扫描算法 · CSS
精确ZOH离散化的状态空间扫描,闭式解替代数值近似,LTI一步精确求解
| 分数 | 原公式:MHA / Softmax | 本框架:GRA |
|---|---|---|
| 连续式 | hdot = A h + B x | 同左; A0 = -I + 2x2 block-skew |
| 离散 | h ← exp(dA) h + d B x | h ← Phi h + Psi B x; Phi/Psi 按块闭式 |
| 系数 | a=exp(d A), b=0, g=d | free ω≈(5.825, 1.916, 0.449); 无梯形 I |
| 稳定 | 谱半径不自动 <1 | rho(Phi)=exp(-0.125)=0.882; cond=5.39 |
屋顶优化 · T_roof
字节/FLOP双维度性能屋顶模型,自适应路由选择最优计算路径
| 分数 | 原公式:MHA / Softmax | 本框架:GRA |
|---|---|---|
| 路由策略 | 固定路径 | 自适应: n≤256 → last_into, 否则 chunked+tree |
| 屋顶公式 | T = bytes/bw + flops/peak | T_roof = max(bytes/160GB/s, FLOP/1.7TFLOP) + 8μs |
代数防线
五层代数验证体系,从序列扫描到CPU半群,每层独立闸门检测
| 分数 | 原公式:MHA / Softmax | 本框架:GRA |
|---|---|---|
| L0 | 扫描全程 | vs 成对向量参照, D=1.37e-14 < 1e-5 |
| L1 | 轨迹一致性 | vs 密 expm ZOH, D=2.63e-13 < 1e-4 |
| L2-L4 | 分块/树/CPU | 全部通过闸门检测 |