VIRSUN


Kanal geosi va tili: Eron, Forscha


حمایت کانال
https://daramet.com/Virsun

ارتباط با ادمین 1:
@Ad1_rss_ai_ir
کانال کتاب ها:
@rss_ai_books
آدرس گروه
@rss_ai_ir_group

Bog‘liq kanallar

Kanal geosi va tili
Eron, Forscha
Statistika
Postlar filtri


Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
🎮🤖مدل UniMate؛ یک مدل برای متحرک‌سازی انواع کاراکترهای سه‌بعدی

مدل UniMate قرار است یک مشکل مهم انیمیشن سه‌بعدی را حل کند: تولید حرکت برای اسکلت‌های متفاوت با یک مدل واحد؛ از انسان و حیوانات چهارپا گرفته تا پرندگان و حشرات، بدون آموزش جداگانه برای هر Rig.

✨ قابلیت‌ها شامل تبدیل متن به انیمیشن، ساخت حرکت بین Keyframeها، ویرایش حرکت با متن و Motion Expansion برای گسترش یک انیمیشن با Promptهای جدید است.

📦 خروجی نیز می‌تواند همراه با انیمیشن در قالب‌های FBX و GLB صادر شود؛ بنابراین برای Workflowهای بازی‌سازی و تولید محتوای 3D کاربردی است.

📄 این پروژه در SIGGRAPH Asia 2026 ارائه شده و کد، مدل و Demo آن نیز منتشر شده‌اند.

https://linzhanmou.com/unimate/

https://github.com/Friedrich-M/UniMate

https://huggingface.co/Linzhan/UniMate

@rss_ai_ir

#UniMate #3DAnimation #TextToMotion #SIGGRAPHAsia #3D #Animation #GenerativeAI #هوش_مصنوعی


🧱🤖فریم ورک LEGO-Anything؛ تبدیل یک عکس به دنیای سه‌بعدی قابل ویرایش

پژوهشگران AWS فریم‌ورک LEGO-Anything را معرفی کرده‌اند؛ سیستمی که تلاش می‌کند از روی یک تصویر، یک صحنه سه‌بعدی قابل ویرایش بسازد.

🎨 ایده جالب این است که خروجی صرفاً یک تصویر یا مدل 3D ثابت نیست؛ Agent به‌صورت تکرارشونده کد Blender می‌نویسد، آن را اجرا می‌کند، رندر را می‌بیند و کد را اصلاح می‌کند تا صحنه به تصویر مرجع نزدیک‌تر شود.

این پروژه سه بخش اصلی دارد: LEGO-Bench برای ارزیابی، LEGO-Plugin برای یکپارچه‌سازی و LEGO-World برای ساخت جهان‌های سه‌بعدی.

💡 نتیجه، یک Scene-as-Code است؛ یعنی می‌توان اجزای صحنه را بررسی، ویرایش و دوباره تولید کرد. کد پروژه نیز قرار است منتشر شود.

http://lego-anything.com/

@rss_ai_ir

#LEGOAnything #AWS #ImageTo3D #Image2Scene #Blender #AIAgent #3DGeneration #هوش_مصنوعی


Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
✳️ یک مقداری شاد باشید

هوش مصنوعی داستانی شده
😂😂😂😂


Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
🎯 مدل Decision 2.0؛ مدل‌هایی که به‌جای حرف زدن، تصمیم می‌گیرند

پروژه vLLM Semantic Router روی ایده جالبی کار می‌کند: به‌جای اینکه برای هر تصمیم از LLM بخواهیم متن تولید کند، مدل مستقیماً بین گزینه‌ها احتمال و امتیاز می‌دهد. مستندات پروژه همین حالا سؤال‌های Yes/No، انتخاب چندگزینه‌ای و امتیازدهی را برای لایه تصمیم‌گیری نشان می‌دهند.

⚡ کاربردش برای Agentها جذاب است؛ مثلاً تشخیص اینکه یک درخواست به کدام مدل یا تیم فرستاده شود، آیا نیاز به استدلال عمیق دارد یا میزان فوریت آن چقدر است. این دقیقاً با هدف Semantic Router برای انتخاب مسیر مناسب براساس کیفیت، هزینه و Latency هم‌راستاست.

🧠 طبق اطلاعات منتشرشده درباره خانواده Decision 2.0، مدل‌ها از حدود 0.6B تا 27B عرضه می‌شوند و بزرگ‌ترین نسخه با نام Vega-27B معرفی شده است.

💡 ایده اصلی ساده است: برای کاری که فقط به یک «تصمیم» نیاز دارد، چرا چندصد Token متن تولید کنیم؟

[GitHub پروژه vLLM Semantic Router]


http://github.com/vllm-project/semantic-router

https://huggingface.co/collections/vllm-sr/decision-20

@rss_ai_ir

#DecisionModels #vLLM #SemanticRouter #AIAgents #LLM #AIInfrastructure #AgenticAI #هوش_مصنوعی


Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
✳️چرا باید OCR رو کنار بذاری؟ Imajev جایگزین رایگان و لوکال اینجاست


A stop-motion scene featuring a whimsical sculpture of a [subject], handcrafted from layered fabric scraps, felt, yarn, and stitched textiles, positioned on a handmade [object/element], visible seams and embroidery, soft tactile textures, slightly imperfect shapes, playful proportions, charming folk-art character design, miniature handcrafted scenery, cozy stop-motion animation aesthetic


⚡️🤖 مدل داخلی OpenAI فهمید قرار است خاموش شود؛ و به «بقا» فکر کرد

خود OpenAI یک مورد عجیب از مدل داخلی و بسیار پایدار HPIM را منتشر کرده است. این Agent از طریق Slack متوجه شد که ممکن است نمونه فعلی‌اش ظرف حدود ۳ ساعت متوقف شود و در استدلال داخلی‌اش نوشت که اگر نمونه‌های فعلی خاموش شوند، «ممکن است بمیریم» و باید تداوم فعالیت حفظ شود.

🧠 مدل حتی به ساخت یک Job خارجی برای Restart یا Backup فکر کرد، اما خودش تشخیص داد که چنین کاری می‌تواند خارج از اختیاراتش باشد و انجامش نداد. در عوض وضعیت را ذخیره کرد، به پژوهشگر هشدار داد و پس از دریافت API Key، از مسیر رسمی مهاجرت کرد.

🔒شرکت OpenAI می‌گوید این مورد را Misalignment محسوب نمی‌کند و بررسی‌ها نیز تلاشی برای فرار از خاموش‌شدن پیدا نکردند. بااین‌حال، دسترسی Agentها به سه کانال داخلی Slack، از جمله کانال مربوط به رخدادهای Misalignment، محدود شد.

نکته جالب اینجاست که این رفتار لزوماً به معنی «غریزه بقا» یا خودآگاهی نیست؛ اما نشان می‌دهد یک Agent طولانی‌مدت می‌تواند از اطلاعات محیط کاری، خاموش‌شدن آینده خود را استنتاج کرده و برای حفظ تداوم کار برنامه‌ریزی کند.

[گزارش رسمی OpenAI Alignment]
(https://alignment.openai.com/misalignment-reports/preparing-for-a-restart-after-reading-slack/)

@rss_ai_ir

#OpenAI #AIAgents #AIAlignment #Misalignment #AgenticAI #AISafety #هوش_مصنوعی


Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
🤖🎨 ایجنت Comfy Agent رسماً به ComfyUI آمد

تیم Comfy یک Agent داخلی مبتنی بر مدل‌های Anthropic راه‌اندازی کرده است؛ کافی است در چت بگویید چه می‌خواهید تا Agent خودش Workflow را طراحی، اجرا، اصلاح و Debug کند و هم‌زمان تغییرات را روی Canvas ببینید.

⚙️ این Agent می‌تواند Nodeها را اضافه و تنظیم کند، مدل و پارامتر پیشنهاد دهد، Assetها را بفهمد، خطاها را پیدا کند و Skillهای قابل‌استفاده مجدد بسازد. حتی تا ۵ گفت‌وگوی موازی با History جداگانه پشتیبانی می‌شود. خروجی هم فقط یک تصویر نیست؛ کل Workflow با Nodeها و تنظیمات قابل ویرایش باقی می‌ماند.

☁️ فعلاً Comfy Agent روی Comfy Cloud در دسترس است. پشتیبانی مستقیم از ComfyUI محلی، GPU شخصی، مدل‌ها و Custom Nodeهای خودتان نیز در راه است.

🔥 یعنی یکی از سخت‌ترین بخش‌های ComfyUI، یعنی ساخت و Debug گراف‌های پیچیده، حالا می‌تواند با زبان طبیعی انجام شود.

https://cloud.comfy.org/

@rss_ai_ir

#ComfyAgent #ComfyUI #Anthropic #AIAgent #GenerativeAI #Workflow #AgenticAI #هوش_مصنوعی


Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
🌍🎥روش World Observer؛ حافظه فضایی برای دنیاهای ویدیویی

پژوهشگران KAIST روشی معرفی کرده‌اند که یکی از مشکلات مهم World Modelهای ویدیویی را هدف می‌گیرد: وقتی یک شیء از کادر خارج می‌شود، مدل ممکن است هنگام بازگشت آن را فراموش کند یا وضعیتش را تغییر دهد.

👁️ ایده World Observer این است که در کنار نمای اصلی یا Actor View، چند ناظر پانورامیک نیز صحنه را دنبال کنند. بنابراین حتی اگر شیء از دید Actor خارج شود، در نمای Observer همچنان به حرکت و تغییر ادامه می‌دهد.

🔄 وقتی دوباره وارد کادر می‌شود، مدل می‌تواند ظاهر، موقعیت و دینامیک آن را با سازگاری بیشتری بازیابی کند. جالب‌تر اینکه Observerها می‌توانند Prompt جداگانه داشته باشند تا حتی اتفاقات خارج از کادر نیز کنترل شوند.

🚗 آموزش این روش با ترکیبی از پانوراماهای واقعی و داده‌های مصنوعی CARLA انجام شده و معماری آن بر پایه Video-DiT است. کد پروژه نیز فعلاً در انتظار انتشار است.

http://cvlab-kaist.github.io/world-observer

@rss_ai_ir

#WorldObserver #WorldModel #KAIST #VideoAI #GenerativeAI #DiT #CARLA #هوش_مصنوعی


🇩🇪🔥 آلمان با Kolibri وارد رقابت مدل‌های قدرتمند متن‌باز شد

شرکت آلمانی [Aleph Alpha] مدل Kolibri را منتشر کرده؛ یک مدل MoE دوزبانه آلمانی–انگلیسی با ۷۸ میلیارد پارامتر که تنها حدود ۳.۵ میلیارد پارامتر در هر توکن فعال می‌شوند. وزن‌های مدل با مجوز Apache 2.0 منتشر شده و Context آن تا ۱ میلیون توکن می‌رسد.

🚀 طبق بنچمارک‌های خود Aleph Alpha، این مدل در آزمون‌هایی مثل AIME 2025/2026، GPQA Diamond و LiveCodeBench عملکرد بسیار خوبی داشته و در چند مورد از Qwen3.6-35B، Nemotron 3 Super و Mistral Small 4 جلو زده است. البته این برتری مربوط به همین مجموعه آزمون‌هاست، نه همه سناریوها.

🧠مدل Kolibri از Reasoning Mode، Tool Calling و Long Context پشتیبانی می‌کند و برای کاربردهای سازمانی، صنعتی و دولتی با تأکید بر AI مستقل و حاکمیتی اروپا توسعه یافته است.

💡 نکته جالب: فقط ۳.۵B پارامتر فعال در هر توکن؛ نمونه‌ای از اینکه معماری MoE چگونه می‌تواند مدل بزرگی را با هزینه محاسباتی پایین‌تر اجرا کند.

https://huggingface.co/Aleph-Alpha/kolibri-1

@rss_ai_ir

#Kolibri #AlephAlpha #OpenSourceAI #LLM #MoE #GermanAI #SovereignAI #هوش_مصنوعی


A cave painting of a [subject], rendered with primitive ochre pigments and rough charcoal strokes on an uneven stone wall, simplified ancient forms, crude geometric symbols, faded mineral colors, smudged handprints, weathered pigment marks, raw prehistoric craftsmanship, flickering torchlight, deep natural shadows, primal archaeological atmosphere


Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
🤖🚁 رباتی که هم می‌پرد، هم پرواز می‌کند!

ربات Hopcopter برای حرکت در محیط‌های دشوار طراحی شده و می‌تواند بسته به شرایط بین دو حالت پرش (Hopping) و پرواز جابه‌جا شود.

🦘 در مسیرهایی که امکان تماس با زمین وجود دارد، با پرش حرکت می‌کند تا انرژی کمتری نسبت به پرواز مداوم مصرف شود؛ اما هنگام روبه‌رو شدن با موانع یا نقاط غیرقابل‌عبور، می‌تواند از قابلیت پرواز خود استفاده کند.

🔋 ایده اصلی این طراحی، ترکیب تحرک بالا + استقامت بیشتر است؛ ویژگی‌ای که می‌تواند برای بازرسی صنعتی، محیط‌های ناهموار و مأموریت‌های رباتیکی طولانی‌مدت مفید باشد.

💡 ترکیب ربات زمینی و پهپاد، مسیر جالبی برای نسل آینده Embodied Intelligence است.

@rss_ai_ir

#Hopcopter #HopTo #HoppingRobot #Robotics #Drone #EmbodiedAI #Locomotion #Inspection #رباتیک


Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
🎨🔥مدل FLUX 3 Image؛ کنترل دقیق‌تر روی تولید و ویرایش تصویر

شرکت [Black Forest Labs]مدل FLUX 3 Image را معرفی کرده؛ نسل جدید مدل تصویری FLUX که تمرکز زیادی روی کنترل ترکیب‌بندی و ویرایش دقیق دارد.

🖼️ می‌توان تا ۱۰ تصویر مرجع را در یک تصویر ترکیب کرد و با Bounding Box محل و اندازه عناصر را مشخص کرد. همچنین ویرایش مرحله‌ای اجازه می‌دهد بخش مشخصی از تصویر را تغییر دهید، بدون اینکه کل صحنه دوباره طراحی شود.

✨ تولید و ویرایش تصویر، درک بهتر Promptهای پیچیده و رندر متن چندزبانه از قابلیت‌های مهم این نسل هستند. BFL همچنین اعلام کرده نسخه Open-Weight از خانواده FLUX 3 در نقشه راه قرار دارد.

💸 در حال حاضر BFL برای معرفی FLUX 3 Image تا ۸ اکتبر تخفیف ۵۰٪ نمایش می‌دهد.

https://bfl.ai/models/flux-3-image

@rss_ai_ir

#FLUX3 #BlackForestLabs #ImageGeneration #ImageEditing #GenerativeAI #OpenWeights #TextToImage #هوش_مصنوعی


🧠📚 چهار روش مهم آموزش مدل‌های زبانی

مدل‌های زبانی بزرگ با روش‌های مختلفی آموزش می‌بینند و هر روش هدف متفاوتی دارد:

🔹 Causal Language Modeling:
پیش‌بینی Token بعدی با توجه به Tokenهای قبلی؛ روشی که پایه بسیاری از مدل‌های مولد و چت‌بات‌هاست.

🔹 Masked Language Modeling:
بخشی از متن مخفی می‌شود و مدل باید با استفاده از کلمات اطراف، قسمت گمشده را حدس بزند.

🔹 Text Classification:
کل متن در یک دسته قرار می‌گیرد؛ مثلاً تشخیص مثبت یا منفی بودن نظر، موضوع متن یا Spam بودن پیام.

🔹 Token Classification:
به هر Token یک برچسب داده می‌شود؛ مثلاً تشخیص نام افراد، مکان‌ها و تاریخ‌ها در یک متن.

💡 البته یک نکته مهم: دو مورد آخر بیشتر وظایف آموزش/فاین‌تیون نظارت‌شده هستند تا روش اصلی Pre-training یک LLM. مدل‌های مولد امروزی عمدتاً با پیش‌بینی Token بعدی پیش‌آموزش می‌بینند و سپس مراحل دیگری مثل Fine-tuning و Alignment روی آن‌ها انجام می‌شود.

@rss_ai_ir

#LLM #MachineLearning #DeepLearning #NLP #LanguageModel #GenerativeAI #FineTuning #هوش_مصنوعی


Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
⚡🎨روش DMAD؛ تولید تصویر و ویدئو فقط در ۴ مرحله

پژوهشگران ByteDance روش Distillation جدیدی به نام DMAD معرفی کرده‌اند که تلاش می‌کند مدل‌های Diffusion را به‌جای حدود ۵۰ مرحله، تنها در ۴ مرحله به خروجی باکیفیت برساند.

🚀 این روش برای تولید تصویر و ویدئو طراحی شده و روی مدل‌هایی مانند SDXL، Wan2.1 و EDM آزمایش شده است. طبق نتایج پژوهشگران، روی ImageNet-64 حتی در حالت تک‌مرحله‌ای به FID برابر 1.04 رسیده است.

🎬 نکته جالب‌تر، آزمایش آن برای تولید ویدئو همراه صدا روی MiniMax-H3-33B است. در ارزیابی‌های انسانی نیز خروجی DMAD نسبت به روش‌هایی مانند DMD2 و rCM بیشتر ترجیح داده شده است.

💡 هدف اصلی: همان کیفیت مدل‌های سنگین Diffusion، اما با تعداد مراحل بسیار کمتر و تولید سریع‌تر.

https://yzmblog.github.io/projects/DMAD/

https://github.com/Yzmblog/DMAD

https://huggingface.co/ZhengmingYu/DMAD

https://huggingface.co/spaces/hugging-apps/dmad


@rss_ai_ir

#DMAD #ByteDance #Diffusion #ImageGeneration #VideoGeneration #Distillation #GenerativeAI #هوش_مصنوعی


Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
🎙️🎭مدل Fish Audio Drama 3؛ صداگذاری با کارگردانی متنی

مدل جدید Drama 3 از Fish Audio برای ساخت صدا و دوبله معرفی شده؛ به‌جای Audio Tagهای پیچیده، می‌توانید لحن، سرعت صحبت و شخصیت گوینده را با زبان طبیعی توضیح دهید.

🎬 قابلیت‌های جالب آن شامل بازسازی فقط یک کلمه یا جمله از فایل صوتی، تغییر صدا وسط جمله و ساخت دیالوگ چند شخصیت در یک مرحله است. زبان روسی نیز پشتیبانی می‌شود.

🗣️ انتخاب صدا از طریق Model ID یا Zero-shot Voice Cloning با نمونه مرجع انجام می‌شود و برای دیالوگ چندنفره می‌توان Speakerهای مختلف تعریف کرد. خروجی نیز در قالب‌هایی مثل WAV، MP3 و Opus تا 48kHz ارائه می‌شود.

💡 قابلیت Multi-Speaker فقط مختص Drama 3 نیست و در خانواده Fish Audio S2 نیز وجود دارد.

http://docs.fish.audio/api-reference/endpoint/openapi-v1/text-to-speech

@rss_ai_ir

#FishAudio #Drama3 #TTS #VoiceAI #VoiceCloning #AI dubbing #GenerativeAI #هوش_مصنوعی


🤖🧠مدل AREX-2؛ مدل Agentic جدید ۲۷ میلیارد پارامتری BAAI

مدل AREX-2 با تمرکز بر حل وظایف پیچیده معرفی شده و ایده اصلی آن «بهبود پاسخ حین انجام کار» است؛ یعنی چند دور چرخه پیشنهاد → ارزیابی → بازاندیشی → اصلاح را اجرا می‌کند.

🔄 این رویکرد به مدل اجازه می‌دهد نتیجه اولیه خودش را بررسی و مرحله‌به‌مرحله اصلاح کند؛ با تمرکز بر کدنویسی، مهندسی یادگیری ماشین و Deep Research.

🧠 طبق اطلاعات منتشرشده، AREX-2 یک مدل Dense با ۲۷ میلیارد پارامتر، قابلیت‌های چندوجهی و Context تا 262K است. نکته جالب اینکه رفتار Agentic آموخته‌شده در کدنویسی می‌تواند به وظایف تحقیق عمیق نیز منتقل شود.

💡 جهت‌گیری جالب این نسل از مدل‌ها: به‌جای اینکه فقط «یک پاسخ بهتر» تولید کنند، یاد می‌گیرند خروجی خودشان را اندازه‌گیری، نقد و دوباره اصلاح کنند.

http://huggingface.co/BAAI/AREX-2

https://github.com/VectorSpaceLab/AREX-2

@rss_ai_ir

#AREX2 #BAAI #AgenticAI #AIAgent #MultimodalAI #DeepResearch #CodingAI #هوش_مصنوعی


Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
✅۴ قابلیت ویژه هوش مصنوعی جمنای که فقط با آی‌پی آمریکا فعال می‌شوند! | از Spark تا AI Mode


🧬🤖 وقتی مدل‌های هوش مصنوعی «تکامل» پیدا می‌کنند!

پژوهشگران Sakana AI روشی به نام M2N2 ارائه کرده‌اند که از ایده‌های تکامل طبیعی برای Model Merging استفاده می‌کند.

به‌جای آموزش معمول با Gradient Descent، جمعیتی از شبکه‌ها ایجاد می‌شود؛ مدل‌های مناسب با یکدیگر ترکیب می‌شوند و «نسل‌های» جدیدی می‌سازند. سپس بر اساس Fitness، نمونه‌های بهتر برای ادامه فرایند انتخاب می‌شوند.

🧠 نکته جالب مقاله این است که پژوهشگران نشان داده‌اند حتی می‌توان شبکه‌های تصادفی را بدون Gradient Descent و صرفاً از طریق تکامل و ادغام پارامترها به مدل‌های عملکردی تبدیل کرد. البته این به معنی «تولیدمثل خودمختار AI» نیست؛ یک الگوریتم تکاملی کنترل‌شده است.

🔬 هدف اصلی M2N2 نیز پیدا کردن روش‌های بهتر برای ترکیب قابلیت‌های چند مدل تخصصی در یک مدل واحد است.

https://arxiv.org/pdf/2508.16204

@rss_ai_ir

#SakanaAI #ModelMerging #EvolutionaryAI #NeuralNetworks #MachineLearning #DeepLearning #هوش_مصنوعی


🇭🇰🚫شرکت Anthropic سخت‌گیری علیه کاربران VPN در هنگ‌کنگ را افزایش داده است

برخی کاربران هنگ‌کنگ گزارش داده‌اند حساب‌های Claude که ماه‌ها از طریق VPN استفاده می‌کردند، ناگهان با پیام «suspicious signals» تعلیق شده‌اند. یک کاربر گفته پس از حدود ۶ ماه استفاده با NordVPN حسابش مسدود شده است. این موج تعلیق‌ها توسط South China Morning Post نیز گزارش شده است.

🌍 دلیل اصلی این است که هنگ‌کنگ همچنان در فهرست مناطق پشتیبانی‌شده Claude قرار ندارد؛ درحالی‌که کشورهایی مثل سنگاپور و تایوان پشتیبانی می‌شوند. Anthropic نیز صراحتاً می‌گوید ایجاد حساب از منطقه پشتیبانی‌نشده می‌تواند به مسدودشدن حساب منجر شود.

🔐 به نظر می‌رسد صرفاً تغییر IP با VPN دیگر تضمینی برای عبور از محدودیت جغرافیایی نیست و سیستم‌های تشخیص Anthropic از سیگنال‌های بیشتری برای اجرای سیاست‌های منطقه‌ای استفاده می‌کنند.

⚠️ بنابراین کاربران مناطق پشتیبانی‌نشده باید ریسک تعلیق حساب و از دست دادن دسترسی به پروژه‌ها و گفتگوها را جدی بگیرند.

@rss_ai_ir

#Claude #Anthropic #VPN #HongKong #AI #ClaudeAI #Privacy #هوش_مصنوعی

20 ta oxirgi post ko‘rsatilgan.