بعد از تست Codebase Memory یه سوال هنوز توی ذهنمه: وقتی یه ابزار یا اسکیل جدید اضافه میکنیم، از کجا میفهمیم واقعا کارمون بهتر شده؟
به نظرم promptfoo میتونه اینجا کمک کنه. چند تا کار واقعی رو قبل و بعد تغییر اجرا کنیم، جوابها رو کنار هم بذاریم و ببینیم کیفیت بهتر شده یا فقط چند تا جواب خوب شانسی گرفتیم.
شما معمولا این تغییرها رو چطوری میسنجین؟
به نظرم promptfoo میتونه اینجا کمک کنه. چند تا کار واقعی رو قبل و بعد تغییر اجرا کنیم، جوابها رو کنار هم بذاریم و ببینیم کیفیت بهتر شده یا فقط چند تا جواب خوب شانسی گرفتیم.
شما معمولا این تغییرها رو چطوری میسنجین؟