「一連串的失敗」造就了 LLM(下篇)— 從 Attention 到規模革命與對齊
從如何處理脈絡到 LLM 的完成:RNN 的結構性極限、Attention 的誕生、Transformer、GPT-3 的規模革命、RLHF 對齊,以及效率化的時代。
從如何處理脈絡到 LLM 的完成:RNN 的結構性極限、Attention 的誕生、Transformer、GPT-3 的規模革命、RLHF 對齊,以及效率化的時代。
LLM 是一連串無關問題的副產品:圖靈的可計算性、夏農的資訊理論、感知器、反向傳播、GPU,以及 Word2Vec。
知識庫檢索能不能用 Fine-tuning 取代 RAG:Fine-tuning 真正學到的是什麼、純 IR 或長脈絡勝出的時機,以及各自的成本。