本文へ移動

再帰的自己改善

大規模モデルのパラメータが増え続けるなか、scaling lawの効率は徐々に落ちていきます。AI時代の第一の曲線が学習データなら、第二の曲線は利用データです。基盤モデル企業が強くなる一方で、アプリケーション層の企業にも強くなり続ける方法があります。

LIVE RELEASE LOOP

いつでも自己進化

ほとんどのAIプロダクトの改善は、データを集め、再学習し、リリースするというバージョン間のサイクルで起こります。しかし私たちは、Agentの進化はユーザーの利用中に起こるべきだと考えています。呼び出し、修正、還流の一つひとつが、次の判断を直接書き換えるべきです。

第二の曲線アプリケーション層の企業にも強くなり続ける方法があります。

バージョン間データ収集 / 再学習 / リリース
利用中呼び出し / 修正 / 還流
  1. 01データ収集
  2. 02再学習
  3. 03リリース
プロダクト内部へ移す
  1. 01呼び出し
  2. 02修正
  3. 03還流
  4. 04能力向上
  1. COLLECT USAGE BATCH
  2. TRAIN CHECKPOINT
  3. SHIP NEXT RELEASE

SHIP · USE · CORRECT · LEARN · SHIP · USE · CORRECT · LEARN

二つの曲線

利用量能力同じ出発点バージョン型改善再帰型改善複利差

バージョン型改善階段

データを集める → 再学習する → リリースする。改善は階段状に進み、傾きはチームの開発能力で決まります。ユーザーが増えるほどアノテーションと推論のコストが高くなり、改善はむしろ遅くなります。

再帰型改善複利

利用そのものが改善になります。曲線は連続的に上昇し、その傾きは利用量で決まります。ユーザーが増えるほど修正信号は密になり、曲線は急になります。コストの向きと改善の向きが初めて一致します。

六つの器がループを成す

機能ごとに並び、順に流れます。終わりは次の始まりとなり、ループが重なりながら進化し続けます。

  1. 01

    知覚

    現実を信号に変える。会議、読書、教室、会話のシナリオは共通の入り口を共有し、文字起こし、スピーカーの分離、音声認識は同じフロアで行われます。シナリオは異なり、システムへのエントリの形式は同じです。

  2. 02

    記憶

    信号を時間の中を移動させる。すべてのソースは同じメモリセットに書き込まれ、繰り返しは蓄積されず、削除は本当に消えます。

  3. 03

    推論

    記憶から、人が何を気にかけているのか、何が得意なのか、どこに向かっているのかなど、人に対する判断力が高まります。判定はメモリとは別に保存されるため、メモリが変化し、判定を全体として再計算することができます。

  4. 04

    修正

    裁きを覆しましょう。確認、修正、無視、積極的に追加すると、4つのアクションが次の推論を直接書き換えます。これはループが閉じ、省略するのが最も簡単な場所です。

  5. 05

    移行

    ある場所での改善が他の場所で有効になるようにしましょう。エンジンとポートレートネットワークは複数の製品ラインで共有されており、1つのシーンで学んだことがそのシーンに固定されることはないことを理解してください。このレイヤーがなければ、互いに独立した4つの表面的な曲線しかありません。

  6. 06

    契約

    新しいシナリオにアクセスするコストはほぼゼロです。1回限りの定義、マルチエンドの自動生成。当社の産業用パイプラインは再利用可能であり、新製品は建築用フォークです。

閉ループを確立するための3つの前提条件

いずれかにカーソルを合わせ、ループがまだ閉じているかどうかを確認します

  • 01

    観察可能:追跡可能

    各判断は、特定の会議、記事、音声、ビデオなどを含む、それを作成した元の記録を指し示すことができる必要があります。ソースを見つけることができれば、逸脱をより良く進化させ、修正することができます。

  • 02

    介入:死羊の罰

    今日、ほとんどのAIポートレートは「読み取り専用」であり、ユーザーが変更できるかどうかは大きな違いです。ユーザーが逸脱を修正するたびに、高品質のデータの一部を無料でラベル付けします。エージェントの人間リングでの自己進化は、学ぶための最良の方法です。

  • 03

    再利用可能:花は春ではありません

    私たちはAI時代の単一の製品会社ではありません。技術的な改善が同じ場所でしか行えない場合は、4つの製品ラインが個別に再生されます。私たちは皆、シーンに蓄積されたバグや経験をバイパスできるという同じ根底にある理解を共有しています。ディメンションゲートの本物の複合化はここからやってくる。

3つのピースが同時に確立された場合にのみ、リングを閉じることができます。それらのいずれかがなければ、「自己進化」は単なる形容詞に過ぎません。

RSIラダー

L 3はストーリーの技術的な分岐点であり、1年以内にエージェントの学習シナリオの90 %が次元ゲートのループで終了すると考えています。

  1. L0ランスルー

    トレース

    システムはあなたの痕跡を残し、痕跡を取得、参照、削除することができます。

  2. L1ランスルー

    修正

    システムの判断を上書きすることができ、上書きはすぐに有効で持続します。

  3. L2ランスルー

    移行

    あるシーンの改善は、自動的に別のシーンの出発点になります。

  4. L3建設中

    ブートストラップ

    このシステムは、シグナルの使用から独自の改善戦略を洗練し、もはや手動トレーニングや公開に依存しません。

  5. L4設計図

    自律性

    システムは、次に何を学ぶべきか、あなたに何を尋ねるべきかを自分で決定し、自分自身の成長のための目標を設定し始めます。

納品可能なプロジェクトに青写真が立っている

圧力測定記録

Zhi Spectrum GLMプロジェクトの建設を主導する実際のビジネスリーダーの1人であり、何億もの同時、Wan Kaクラスターの実際のエンジニアリング能力の上限

289
ビジネスルールの単一テスト
56
アサーションのエンドツーエンドのクローズドループテスト
2000+
req/s normal interface throughput
2.28s
フォローアップ遅延p 95
0%
圧力測定誤差率

同時実行性は購入できません

アクセスレイヤーやストリーミングメディア配信から推論スケジューリングまで、フルスタッククラスタは自己構築され、パブリッククラウドPaaSに依存しています。アクセス層はステートレスで、容量はノードと直線的に拡張され、拡張容量はマシンに追加されるため、アーキテクチャを変更する必要はなく、クラウドベンダーのクォータ承認を待つ必要もありません。

同時キャパシティ ↑概略図、非測定曲線ノード →

曲線のコスト方向は下向きです

2つの方向性が同時にあります。基本的な再利用により、新しいシナリオの限界研究開発コストが減少します。インフラストラクチャ全体は自己構築されており、パブリッククラウドPaaSに依存しておらず、推論と帯域幅の限界コストを制御可能にします。

私たちは常に長期主義の道を選びます。コスト曲線は徐々に減少するだけです