TinyLoRA の式は W' = W + U Σ (Σ_{i=1}^{u}…
jrf> TinyLoRA の式は W' = W + U Σ (Σ_{i=1}^{u} v_i P_i) V^⊤ だが、これは W' = W (I + v1 P1 + v2 P2 +…) という式で行ってもだいたい遜色なくできる。つまり単純な「積」である。I P1 P2 … を正規直交化すれば、訓練が早くなるようだ。
これはモデルをとても単純にする。TinyLoRA を「低ランク更新」から「低次元群作用」に再定式化している…と言える。
ChatGPT さんによるとスタッキングを可能とする方向として W' = W exp(v1 A1 + v2 A2 + ...) という方向がおもしろそうだと示された。
実は、TinyLoRA について以前、調べたのだが、実験失敗だけが結果報告になっていて、何も有用な結果として残ってなかったのが気にかかっていて、その議論で、意味がありそうなもののみ、再度 ChatGPT さんにお願いして実験してもらったのだった。そして以上がその結論になる。
ChatGPT さんとの会話は↓になる。
https://chatgpt.com/share/69c3b83b-f118-8322-a439-203f184d03b6