Knowledge
怎樣評估 LLM 應用:由示範走向量產
Evaluating LLM apps: from demo to production
本日瀏覽 · 0 · 累計瀏覽 · 0
- 評測
- 品質
- 生產
- MLOps
示範階段可用幾條「金鑰問題」;量產需要更大測試集,涵蓋邊界情況與失敗模式。
分開追蹤:事實正確性、格式正確、語氣合規、延遲與成本——每項有不同量測方式。
線上環境可記錄使用者修正、點讚/投訴與人工覆核比例,作為下一輪迭代依據。
對 AutoChat:金鑰問題包括「而家開唔開」「預約星期六三點」「冇寫嘅療程點答」。最後一條應該轉交店員,而唔係編造。
對 AdReel:除「有冇片出街」,仲要睇人審退回率、音樂/面孔風險、以及額度有冇喺預期內燒完。
官網控制台示範數據唔可以當評測。評測要用你自己嘅真實後台同固定題庫,否則會把樣本指標誤當成 SLA。
為這篇文章評分(1–5 星)