Pedi | پِدی


Channel's geo and language: Iran, Persian



Channel's geo and language
Iran, Persian
Statistics
Posts filter




💬 خب، کار روی LaBeLa همچنان ادامه داره

هزینه‌ی ابزارهایی که برای ساختش نیاز دارم یه کم بالا رفته، ولی امیدوارم شما هم ظاهر و مسیری که اپ تا اینجا گرفته رو دوست داشته باشید.

دارم همه‌ی نظراتتون رو با دقت می‌خونم و قدم‌های اول رو با کمک همین پیشنهادها و ایده‌های شما برمی‌دارم. دوست دارم این اپ رو با هم بسازیم.

فعلاً داریم چارچوب ظاهری و تجربه‌ی کار با اپ رو مشخص می‌کنیم. وقتی معلوم شد به کدوم سمت می‌ریم، قدم بعدی طراحی دیتابیس با همدیگه‌ست.

به نظرم Data Layer مهم‌ترین بخش یه اپه. یه بک‌اند بد رو می‌شه از نو نوشت، اما اگه مدل داده از اول بد طراحی شده باشه، اصلاحش بعد از اینکه کلی اطلاعات و کاربر وارد سیستم شدن، خیلی پرهزینه‌تر و دردسرسازتر می‌شه.

بعد از بررسی کلی اپ مشابه و کنار هم گذاشتن ایده‌های شما، فعلاً به این ظاهر و قابلیت‌ها رسیدیم.

🔥نظرتون چیه؟ کدوم بخش رو بیشتر دوست دارید و کجاها هنوز جای بهتر شدن داره؟

734 0 5 12 61

👀 اگه کدی که AI نوشته رو نمی‌فهمی، باید منتشرش کنی؟

اپ اجرا می‌شه و تست‌ها سبزن. ولی نمی‌دونی کاربر چطور از دیدن اطلاعات بقیه منع می‌شه، یا اگه درخواست پرداخت دوبار برسه، دوبار پول کم می‌شه یا نه

این‌جا «کار می‌کنه» دقیقاً یعنی چی؟ تست‌ها فقط چیزهایی رو بررسی می‌کنن که براشون سناریو نوشتیم

البته قرار نیست همه خط‌های کد و کتابخونه‌ها رو حفظ باشیم. اما کسی که محصول رو منتشر می‌کنه باید بتونه سه چیز رو توضیح بده:

• تصمیم‌های حساس سیستم چطور گرفته شدن
• چه شواهدی داریم که حالت‌های خطا درست مدیریت می‌شن
• اگه نسخه جدید خراب شد، چطور متوجه می‌شیم و بازیابیش می‌کنیم

برای یه ابزار شخصی شاید ریسک بیشتری قابل‌قبول باشه؛ برای محصولی که پول و اطلاعات مردم دستشه، معیار باید سخت‌گیرانه‌تر باشه

به‌نظرتون حداقل دانشی که برای انتشار کدکه نوشته AI چقدره؟


این بار از AI بخواین کدش رو توی مرورگر امتحان کنه 👀

اگه با کمک AI وب‌اپ می‌سازین، ابزار Playwright CLI از مایکروسافت می‌تونه به agent اجازه بده صفحه رو باز کنه، روی دکمه‌ها کلیک کنه، فرم پر کنه و از نتیجه اسکرین‌شات بگیره.

یه تست کاربردی
بهش بگین: «روی نسخه لوکال، فرم ثبت‌نام رو با ایمیل نامعتبر تست کن. بعد با اطلاعات آزمایشی معتبر امتحانش کن و از هر دو حالت اسکرین‌شات بگیر.»

برای شروع
با نصب Node.js، این دو دستور رو توی ترمینال اجرا کنین:
npm install -g @playwright/cli@latest
playwright-cli install --skills

دستور دوم skill رو برای Claude Code نصب می‌کنه؛ برای مسیر مشترک agentها مثل Codex، از --skills=agents استفاده کنین.

طبق توضیح پروژه، روش CLI می‌تونه مصرف توکن رو نسبت به فرستادن مداوم اطلاعات مفصل صفحه کمتر کنه؛ مقدار صرفه‌جویی به سناریو بستگی داره.

خود ابزار متن‌باز و رایگانه؛ هزینه مدل یا اشتراک agent جداست. اول روی محیط تست و با داده آزمایشی اجراش کنین و نتیجه‌ها رو خودتون هم بررسی کنین.

گیت‌هاب و راهنمای شروع


به جای توضیح دادن «اون دکمه رو می‌گم»، روش کلیک کن 👀

اگه با Codex یا Claude Code رابط کاربری می‌سازین، احتمالا پیش اومده نصف پرامپتتون صرف توضیح دادن این بشه که دقیقا کدوم قسمت صفحه باید تغییر کنه 😅

ابزار Agentation یه نوار ابزار به پروژه اضافه می‌کنه؛ روی المان موردنظر کلیک می‌کنین و می‌نویسین چه تغییری می‌خواین.

مثلا:
«فاصله این دکمه از عنوان، ۱۶ پیکسل باشه و توی حالت loading عرضش تغییر نکنه.»

⭐️ نکته کاربردیش اینه که بازخورد رو همراه selector و اطلاعات المان به agent می‌رسونه. می‌تونین خروجی Markdown رو کپی کنین یا با تنظیم MCP، کامنت‌ها رو مستقیم در اختیار agent بذارین.

برای Claude Code یه skill راه‌اندازی هم داره:
npx skills add benjitaylor/agentation

بعد داخل Claude Code دستور /agentation رو اجرا می‌کنین.

فعلا به React 18+ و مرورگر دسکتاپ نیاز داره و بهتره فقط توی محیط توسعه فعال باشه. تغییر کد رو agent انجام می‌ده؛ نتیجه رو هم همچنان باید بررسی کنین.

برای رفت‌وبرگشت‌های ریز طراحی، ایده کاربردی‌ایه 🔥

معرفی و دمو · راهنمای نصب


یه اسم برای اپ توی ذهنمه: LaBeLa، همون «لابه‌لا» 👀

چرا این اسم؟ چون توی زبان، خیلی چیزها لابه‌لای کلمه‌ها اتفاق می‌افتن؛ لحن، مکث، ریتم و حسی که به جمله می‌دیم.

توی اپ هم قراره همین مسیر رو تجربه کنیم: اول گوش بدیم، همراه گوینده تکرار کنیم و کم‌کم خودمون وارد گفتگو بشیم. راهنما آروم‌آروم کنار می‌ره تا جای بیشتری برای صدای ما باز بشه.

برای من، داستان این اسم اینه:
«لابه‌لای گفتگو، صدای خودت رو پیدا کن.» 🎙

هنوز اسم رو نهایی نکردم، ولی این ارتباط بین اسم و تجربه اپ رو دوست دارم.

شما چی فکر می‌کنین؟ LaBeLa به نظرتون چه حسی داره؟


رفقا، پیشنهادها و تجربه‌هاتون درباره اپ Shadowing رو خوندم. ممنون از همگی ❤️ چند نکته مهم از بحث زیر پست:

- پیشنهاد MiIAD و Mohamad: ترکیب تمرین با یادآوری فعال، ذخیره لغت از زیرنویس و مرور فاصله‌دار
- پیشنهاد Mohammad Mehdi و H: راهنمای مرحله‌ای برای هر محتوای جدید، کنترل زیرنویس و توجه به تلفظ کلمه‌ها داخل جمله؛ بازخورد هم فقط تطبیق متن نباشه
- پیشنهاد #Ho3ein: آپلود ویدیوی دلخواه؛ بحث Nahang، H و Mohammad Mehdi هم روی محتوای جذاب و حق انتخاب کاربر بود
- تجربه 'https://t.me/iampediii/57?comment=630' rel='nofollow'>سایه: اینترنت ایران، ضبط صدای ضعیف، ترجمه ناقص و محدودیت شدید نسخه رایگان می‌تونن تجربه یک اپ رو خراب کنن. ممنون بابت این بررسی دقیق

🎙 نقش AI توی اپ

قراره از APIهای صوتی زیاد استفاده کنیم؛ از ElevenLabs برای ساخت صدا و مکالمه با شخصیت‌ها و لهجه‌های مختلف، و از Azure Pronunciation Assessment برای بررسی گفتار شما. متن تشخیص‌داده‌شده رو با جمله اصلی مقایسه می‌کنیم، تفاوت‌ها رو نشون می‌دیم و برای میزان تطابق امتیاز می‌ذاریم. ارزیابی تلفظ و ریتم صحبت بخش جداگانه‌ایه که باید دقیق بررسی و تستش کنیم.

⭐️ الان کجای کاریم؟

من پروتوتایپ‌های اولیه رو شروع کردم. توی بک‌اند و طراحی سیستم دستم راهه، ولی برای پیاده‌سازی موبایل یا باید با یکی از شما همکار بشم، یا کل این بخش رو با کمک AI جلو ببرم 😄 اگه موبایل کار می‌کنین و علاقه دارین، بگین.

قراره این اپ رو با هم بسازیم. هر قدم، از طراحی و انتخاب تکنولوژی تا کدنویسی، تست و انتشار رو باهاتون به اشتراک می‌ذارم؛ تصمیم‌ها و تغییر مسیرها هم همین‌طور 😎


ولی یه چیزی بهتون بگم، دامنه tele.pages هم خریدم برای ایده تبدیل تلگرام به وبسایت.

یکم از کارای حقوقیش نگرانم چون مردم،توی تلگرام از ویدیو های غیرقانونی عجیب، تا فیلم کپی و خرید و فروش مواد انجام میدن.

باید یک فکر و مدیریتی دنبال این موضوع باشه. وگرنه خودمم این ایده رو خیلی دوست دارم.

3.5k 0 12 11 69

خب، نظرسنجی تموم شد!

قراره با هم یه اپلیکیشن تمرین زبان با روش Shadowing بسازیم.

از اینجا به بعد اسم، ایده‌ها و طرح‌ها رو باهاتون به اشتراک می‌ذارم. هر جا هم بشه لایو می‌ذاریم؛ از طراحی ظاهر اپ و تجربه کاربری تا طراحی سیستم و کدنویسی.

توی این مسیر هم از شما یاد می‌گیرم، هم هر تجربه‌ای که دارم می‌ذارم وسط تا با هم یه اپ خوب بسازیم و روی Play Store منتشرش کنیم.

هزینه اشتراکش هن هرچقدر هم بشه، به تعداد ۲۵۰۰ نفر اعضای این کانال، اشتراک رایگان توی اپ در نظر می‌گیریم 🔥

اما Shadowing چیه؟

کلمه shadow یعنی «سایه». توی این روش به صدای یک نفر گوش می‌دین و با فاصله خیلی کوتاه، مثل سایه دنبالش حرف می‌زنین. سعی می‌کنین تلفظ، ریتم، تاکیدها و مکث‌هاش رو تقلید کنین؛ نه اینکه فقط جمله رو حفظ کنین و بعد بگین.

مثلا یه مکالمه کوتاه توی کافه رو می‌شنوین و همراه گوینده تکرارش می‌کنین. هدف اینه که گوش و زبونتون با هم تمرین کنن و کم‌کم صحبت کردن براتون روان‌تر بشه.

چیزی که برای اپ توی ذهنمه 👀

می‌خوام تمرین‌ها کوتاه و بر اساس موقعیت‌های واقعی باشن؛ مثل سفارش قهوه، سفر یا صحبت توی محیط کار.

اول مکالمه رو می‌شنوین و با عبارت‌هاش آشنا می‌شین. بعد همراه صدا تمرین می‌کنین، صدای خودتون رو ضبط می‌کنین و با گوینده مقایسه می‌کنین.

کم‌کم متن و کمک‌ها کمتر می‌شن، تا جایی که خودتون نقش یکی از طرف‌های مکالمه رو می‌گیرین. آخرش هم موقعیت رو یه کم تغییر می‌دیم تا فقط تکرار یک جمله نباشه و بتونین از چیزهایی که یاد گرفتین استفاده کنین.

ایده اینه که هر بار اپ رو باز می‌کنین، بدون شلوغی و سردرگمی معلوم باشه الان باید چی کار کنین و قدم بعدی چیه.

این تصویر اولیه‌ایه که توی ذهنمه؛ جزئیاتش رو توی مسیر با هم بهتر می‌کنیم. اگه تجربه‌ای از Shadowing دارین، بگین چی کمکتون کرده و کجاش سخت بوده؟

3.8k 0 29 38 125

اونی که خودم دوست دارم با اختلاف کم جلو تره :))
تا فردا ادامه بدیم ببینیم چی میشه


کدوم ایده رو با هم بسازیم؟
Poll
  •   تمرین انگلیسی با Shadowing
  •   زمین بازی سیستم‌دیزاین
  •   تبدیل کانال تلگرام به وب‌سایت
  •   ایده‌ی خودت رو بگو 💡
72 votes


🚀 بیاید با هم یه اپلیکیشن واقعی بسازیم!

حدود ۲۵۰۰ دلار کردیت ChatGPT دارم و می‌خوام ازش برای ساخت یه پروژه با شما استفاده کنم.

ایده رو با هم انتخاب می‌کنیم، مسیر طراحی و برنامه‌نویسیش رو به‌صورت آموزشی جلو می‌بریم، منتشرش می‌کنیم و بعد می‌ریم سراغ مارکتینگ و جذب کاربر. ببینیم می‌تونیم به محصولی برسیم که مردم حاضر باشن بابتش پول بدن یا نه 👀

این چهار تا گزینه رو داریم:
۱. تمرین انگلیسی با Shadowing 🎙
یه اپ برای تمرین شنیدن و صحبت کردن: یه جمله رو می‌شنوید، با فاصله‌ی کوتاه تکرارش می‌کنید و صداتون رو ضبط می‌کنید. بعد می‌تونید صدای خودتون رو با گوینده مقایسه کنید و روی تلفظ، ریتم و روان‌تر صحبت کردن کار کنید.

۲. زمین بازی سیستم‌دیزاین 🏗
یه محیط تعاملی برای ساختن و آزمایش معماری نرم‌افزار. سرور، دیتابیس، کش و صف پیام رو کنار هم می‌چینید و توی شبیه‌سازی می‌بینید با زیاد شدن ترافیک یا خراب شدن یکی از بخش‌ها چه اتفاقی می‌افته. یادگیری سیستم‌دیزاین با آزمایش کردن!

۳. تبدیل کانال تلگرام به وب‌سایت 🌐
توی کانالتون پست می‌ذارید و پست‌های انتخاب‌شده خودکار روی یه سایت با دامنه‌ی خودتون منتشر می‌شن. سایت دسته‌بندی، جست‌وجو و آرشیو مرتب داره؛ مثلاً آموزش‌ها و ابزارهایی که طی چند سال معرفی کردید، تبدیل می‌شن به یه کتابخونه‌ی قابل جست‌وجو.

۴. ایده‌ی خودت رو بگو 💡
اگه پیشنهادی داری، توی کامنت‌ها بگو اپ چی کار می‌کنه، مشکل چه کسی رو حل می‌کنه و چرا اون آدم ممکنه بابتش پول بده.


👇 بعد از این پست نظرسنجی می‌ذارم. رأی بدید کدوم رو با هم بسازیم!

5.6k 0 25 24 39

بعد از تست Codebase Memory یه سوال هنوز توی ذهنمه: وقتی یه ابزار یا اسکیل جدید اضافه می‌کنیم، از کجا می‌فهمیم واقعا کارمون بهتر شده؟

به نظرم promptfoo می‌تونه اینجا کمک کنه. چند تا کار واقعی رو قبل و بعد تغییر اجرا کنیم، جواب‌ها رو کنار هم بذاریم و ببینیم کیفیت بهتر شده یا فقط چند تا جواب خوب شانسی گرفتیم.

شما معمولا این تغییرها رو چطوری می‌سنجین؟


از کجا بفهمیم پرامپت جدید واقعا بهتر شده؟ 👀

احتمالا براتون پیش اومده که پرامپت رو تغییر بدین، چند تا جواب خوب بگیرین و فکر کنین کار بهتر شده. ولی بعد روی یه ورودی دیگه، چیزی که قبلا درست کار می‌کرد خراب بشه.

برای همین، چند بار امتحان کردن توی چت کافی نیست؛ مخصوصا وقتی قراره از مدل داخل یه محصول استفاده کنیم.

ابزاری به اسم promptfoo هست که می‌تونین باهاش چند مدل یا چند نسخه از پرامپت رو با ورودی‌های یکسان تست کنین و نتیجه‌ها رو کنار هم ببینین. این ابزار متن‌بازه و می‌تونین براش مشخص کنین چه جوابی قبول بشه و چه جوابی رد.

چطور شروع کنیم؟

برای شروع ۲۰ مثال از کاری که واقعا می‌خواین انجام بدین جمع کنین. چند مورد ساده، چند مورد مبهم و چند موردی که قبلا به مشکل خورده. بهتره اطلاعات واقعی و خصوصی کاربرها رو وارد این تست‌ها نکنین.

بعد مشخص کنین از هر مثال چه انتظاری دارین و هر دو نسخه رو با همین تست‌ها اجرا کنین.

مثلا اگه مدل قراره پیام‌های پشتیبانی رو دسته‌بندی کنه، فقط معتبر بودن JSON کافی نیست؛ باید ببینین دسته‌ای که انتخاب کرده هم درسته یا نه.

داخل این ابزار، هم می‌شه ساختار JSON رو چک کرد، هم برای تست‌های اختصاصی از JavaScript یا Python استفاده کرد. اگه هم به API مدل‌ها وصلش کنین، هزینه استفاده از اون مدل‌ها جدا حساب می‌شه.

نکته مهم

فقط امتیاز آخر رو نگاه نکنین؛ جواب‌های اشتباه رو هم بخونین. هر بار هم که یه باگ پیدا کردین، همون مثال رو به تست‌ها اضافه کنین تا دفعه بعد دوباره از زیر دستتون رد نشه.

این ۲۰ مثال همه چیز رو پوشش نمی‌ده، ولی برای شروع خیلی بهتر از اینه که فقط با چند جواب خوب تصمیم بگیریم.

لینک‌ها: گیت‌هاب ابزار · شروع سریع · مستندات تست‌ها

#هوش_مصنوعی #برنامه_نویسی #تست


حالا ببینید اون طرف، توی تیم ایلان ماسک چه خبره! 😂

👀 هنوز خبر معرفی داتسِ اوپن‌ای‌آی داغه که ماجرای دامنهٔ dot.com حسابی جلب توجه کرده؛ طبق گزارش تک‌کرانچ، این دامنه متعلق به شرکت ماسکه و کاربرها رو به سمت گروک می‌فرسته! معلوم نیست این حرکت عمداً برای کل‌کل با اوپن‌ای‌آی بوده یا نه، ولی سوژه‌ش آماده‌ست!

از نظر اسم و دامنه، به نظرم «دات‌کام» خیلی خوش‌حافظه‌تره. کوتاهه، راحت گفته می‌شه و سریع توی ذهن می‌مونه.

البته دات‌کام اسم یه سرویس جدید نیست. محصولی که با داتس رقابت می‌کنه، گروک بات (Grok Bot) هست که از ۱۱ اوت معرفی شده بود؛ یعنی قبل از داتس.

💀 چه شباهتی دارن؟
هر دو می‌خوان یه همکار هوش مصنوعی باشن که کار رو بهش بسپری: توی فضای ابری کار کنه، با اجازه‌ات سراغ ابزارها و اپ‌ها بره، روش کارت رو یاد بگیره و حتی وقتی پای کامپیوتر نیستی، پروژه‌هات رو جلو ببره.

اما فرق‌های جالبشون چیه؟
🔹 تیم‌سازی با چند بات: توی گروک بات می‌تونی چند دستیار با مسئولیت‌های مختلف بسازی که با هم حرف بزنن و کار رو به هم تحویل بدن. داتس فعلاً با یک دستیار اصلی شروع می‌شه و اوپن‌ای‌آی تیمی از دات‌ها رو برای آینده مطرح کرده.

🔹 یادگیری با دیدن کار تو: گروک بات قابلیتی رو معرفی کرده که یک‌بار روش انجام کار رو بهش نشون می‌دی، اون رو به شکل یک روال ذخیره می‌کنه و دفعات بعد اجراش می‌کنه. این قابلیت توی معرفی داتس به همین شکل مطرح نشده.

🔹 محیط کار و ارتباط: بات‌های گروکِ هر کاربر یک کامپیوتر ابری مشترک دارن و فایل‌ها و ورود به سایت‌ها رو به اشتراک می‌ذارن. داتس روی ارتباط از طریق چت‌جی‌پی‌تی، اسلک و تیمز و حفظ زمینهٔ گفتگو بین این محیط‌ها تأکید داره.

به نظرم گروک بات روی کاغذ رقیب جدی داتسه و توی همکاری چند دستیار، امکانات آماده‌تری ارائه می‌ده. ولی برای اینکه بگیم کدوم واقعاً بهتر کار می‌کنه، باید هر دو رو با کارهای یکسان امتحان کنیم.


اوپن‌ای‌آی داتس (Dots) رو معرفی کرده؛ یه دستیار هوش مصنوعی که کم‌کم سلیقه و روش کارت رو یاد می‌گیره و می‌تونه شبانه‌روزی پروژه‌هات رو جلو ببره! 🤖

هر دات، کامپیوتر ابری خودش رو داره، با اجازهٔ تو به اپ‌هات وصل می‌شه و می‌تونه چند کار رو هم‌زمان انجام بده. مثلاً:

🧑‍💻 برای برنامه‌نویسی، بازخورد کاربرها رو بررسی کنه، باگ‌ها رو پیدا و برطرف کنه، تست بگیره و یه درخواست ادغام کد آمادهٔ بررسی تحویلت بده.

🎬 برای تولید محتوا، از متن مصاحبه بخش‌های مناسب کلیپ رو پیدا کنه و متن پست‌های شبکه‌های اجتماعی رو آماده کنه.

📊 برای تحلیل داده، با رسیدن اطلاعات جدید، تحلیل‌ها و گزارش‌هات رو به‌روز کنه.

از طریق ChatGPT، اسلک و تیمز باهاش در ارتباطی؛ وقتی هم بین این محیط‌ها جابه‌جا می‌شی، یادش می‌مونه دربارهٔ چی صحبت کردین و کار کجا رسیده.

کنترل هم دست خودته: مشخص می‌کنی به چی دسترسی داشته باشه و برای چه کارهایی تأییدت رو بگیره. بررسی‌های خودجوشش در پس‌زمینه هم فقط برای خوندن اطلاعاته.

عرضه این قابلیت برای کاربران پلن‌های پرو و بیزنس پریمیوم در کشورهای واجد شرایط شروع شده. اولین دات هزینهٔ اضافه نداره، اما کارهای سنگین‌تر سهمیه دارن؛ یعنی شبانه‌روزی در دسترس بودنش، به معنی استفادهٔ نامحدود نیست.


🙏 Source


🧪 حالا این تست‌ها رو چطوری انجام دادم؟

توی پست قبلی گفتم چرا تصمیم گرفتم ویدیوی Codebase Memory MCP رو ادامه ندم. اینجا هم می‌خوام توضیح بدم چطور تستش کردم تا خودتون بتونید دربارهٔ نتیجه قضاوت کنید.

مقایسه ساده بود: همون مدل، همون پروژه، همون سؤال‌ها؛ یک بار با MCP و یک بار بدون اون. سه چیز رو هم بررسی کردم: کیفیت جواب، مصرف توکن و زمان اجرا.

✨ در مجموع ۲۴ بار تست گرفتم
تست‌ها رو توی دو دور انجام دادم: اول با دستورالعمل‌هایی که شخصی‌سازی کرده بودم، بعد با برگردوندن تنظیمات پیش‌فرض نسخهٔ v0.11.0. هر دور هم ۱۲ اجرای تازه داشت.

✨ سه مدل سؤال پرسیدم
• اگه بخشی از کد تغییر کنه، کدوم سرویس‌ها و قسمت‌های دیگه تحت‌تأثیر قرار می‌گیرن؟
• یک رویداد از کجا شروع می‌شه، از چه بخش‌هایی رد می‌شه و اطلاعاتش کجا ذخیره می‌شه؟
• یک تابع مشخص، توی یک فایل مشخص، دقیقاً چیکار می‌کنه؟

یعنی هم سراغ سؤال‌هایی رفتم که نیاز به گشتن توی پروژه و پیدا کردن ارتباط‌ها داشتن، هم سؤال مستقیم دربارهٔ یک تکه کد.

✨ شرایط رو تا جای ممکن یکسان نگه داشتم
مدل GPT-6 Astra با سطح استدلال متوسط، نسخهٔ پروژه، متن سؤال‌ها، دسترسی فقط برای خوندن کد و سقف جواب ۹۰۰ کلمه‌ای یکسان بودن.

هر سؤال رو در هر حالت دو بار اجرا کردم. بار دوم هم ترتیب رو برعکس کردم؛ یعنی اگه دفعهٔ اول با MCP شروع کرده بودم، دفعهٔ دوم بدون اون شروع کردم.

✨ چک کردم مدل واقعاً از چه ابزارهایی استفاده کرده
بدون MCP، مدل با ابزارهای معمول خودش کد رو جست‌وجو می‌کرد و می‌خوند. با MCP، اتصال ابزار و دستورالعمل‌هاش هم در دسترس بودن. لاگ‌ها رو بررسی کردم تا ببینم واقعاً چه استفاده‌ای ازش شده.

✨ کیفیت جواب‌ها رو چطور سنجیدم؟
از قبل، بر اساس کد واقعی پروژه، مشخص کرده بودم هر جواب باید چه نکته‌هایی رو پوشش بده. بعد دو ارزیاب هوش مصنوعی جداگانه، جواب‌ها رو با کد پروژه مقایسه کردن.

ارزیاب‌ها نمی‌دونستن کدوم جواب با MCP تولید شده، چقدر توکن مصرف کرده یا چقدر طول کشیده. نکته‌های جاافتاده، ادعاهای اشتباه و اینکه ارجاع‌ها واقعاً پشتوانهٔ حرف‌ها هستن یا نه هم جدا بررسی شدن.

✨ فقط عدد نهایی رو نگاه نکردم
مصرف توکن رو از خروجی خام CLI گرفتم: ورودی، بخش کش‌شدهٔ ورودی و خروجی. بخش کش‌شده رو دوباره به ورودی اضافه نکردم که مصرف اشتباهی بیشتر حساب نشه.

زمان اجرا، تعداد دفعات استفاده از ابزارها و حجم متنی که ابزارها برمی‌گردوندن رو هم ثبت کردم. همهٔ اجراها، حتی خطاهای ابزار، نگه داشته شدن. تغییر نکردن کد پروژه، هش دستورالعمل‌ها و شمارنده‌های مصرف رو هم چک کردم. دستورها، جواب‌ها، لاگ‌ها و امتیازها هم ذخیره شدن.

اما این تست محدودیت هم داشت.
فقط روی یک پروژه بود و ایندکس از قبل آماده بود؛ پس هزینهٔ ساخت ایندکس و ارزیابی جواب‌ها توی مقایسه نیومده. وضعیت کش و شلوغی سرویس‌دهنده هم دست من نبود.

برای همین نمی‌گم این ابزار برای همه و همه‌جا همین نتیجه رو می‌ده. حتی تفاوت دو دور تست رو هم نمی‌شه فقط به تغییر دستورالعمل‌ها نسبت داد.

حرفم اینه: توی شرایطی که من امتحان کردم، نتیجه اون چیزی نبود که انتظار داشتم. روش تست رو هم توضیح دادم تا شما فقط به حرف من تکیه نکنید و بدونید این برداشت از کجا اومده. 🙂


چرا ویدیوی Codebase Memory MCP رو منتشر نمی‌کنم؟🙂

قول داده بودم دربارهٔ این ابزار ویدیو بسازم. مدتی هم با اتکا به مستنداتش ازش استفاده کردم؛ با انتظار کاهش مصرف توکن تا ۹۰٪ و بهتر شدن دقت پاسخ‌ها.

موقع ساخت ویدیو، خواستم این تأثیر رو در عمل هم نشون بدم. برای همین با Codex، روی چند سناریو و شکل مختلف درخواست، استفاده از ابزار رو با حالت بدون اون مقایسه کردم.

🥺اما نتیجه با چیزی که انتظار داشتم جور درنیومد.
توی تست‌های من، مصرف توکن کمتر نشد و در بعضی اجراها حتی چند برابر شد. تفاوت دقت و کیفیت پاسخ‌ها هم اون‌قدر چشمگیر نبود که این هزینهٔ اضافه رو توجیه کنه.

❓این به معنی بی‌فایده بودن ابزار در تمام پروژه‌ها و شرایط نیست؛ اما برای کاربردهایی که من امتحان کردم، شواهد کافی برای توصیه‌کردنش پیدا نکردم. برای همین تصمیم گرفتم ساخت ویدیوی معرفی و توصیهٔ این ابزار رو ادامه ندم. بابت تغییر برنامه هم خواستم دلیلش رو شفاف باهاتون در میون بذارم.

💬 اشتباه من این بود که قبل از اندازه‌گیری، زیادی به ادعاهای مستندات تکیه کردم. حتی تست‌ها رو با این ذهنیت شروع کردم که «این مزیت رو ثابت کنم»، درحالی‌که باید می‌پرسیدم: «اصلاً این مزیت توی شرایط من وجود داره؟»

🗣️ درس این تجربه برای من این بود: مستندات نقطهٔ شروع بررسی‌ان؛ نتیجه رو باید با تست روی کار واقعی خودمون بسنجیم. حتی وقتی برای یاد گرفتن یک ابزار وقت گذاشتیم یا قول معرفی‌ش رو دادیم، باید بتونیم با دیدن نتیجهٔ متفاوت، نظرمون رو عوض کنیم.

اعتماد شما برام مهم‌تر از منتشر کردن ویدیوییه که دیگه پشت توصیه‌ش نمی‌ایستم.


یه چیزی پختم براتون 👨‍💻

یکم اسکیل رو دستکاری کردم تا فقط زمانی که نیازه یکسری درخواست هارو به MCP بفرسته.

😎 و نتیجه؟ رسید به ۳۰ تا ۴۰٪ مصرف کمتر توکن.
و ۱۰٪ مصرف context window کمتر.


یک issue هم براشون باز کردم
https://github.com/DeusData/codebase-memory-mcp/issues/2278

ویدیو رو با همین ورژن بهتر شده ضبط میکنم و این ااسکیل رو براتون میفرستم.

توی همین issue هم گذاشتمش اگر همین الان از این ابزار استفاده میکنید میتونید به این اسکیل تغییرش بدید.


خوب درستش کردم 😎

با این ویدیو باید این اسکیل جدید هم شیر بکنم.

یکم روش کار میکنم شاید توی کد اصلی هم قبولش کردند.

20 last posts shown.