تک تالک ششم: چالشهای هزینههای Cloud و FinOps و مدیریت زیرساخت
خلاصه
نشست هماندیشی مدیران فنی پیرامون چالشهای FinOps، انتخاب میان Cloud و Bare-Metal، مدیریت Disaster Recovery، سیاستهای Data Retention و بهینهسازی هزینههای هوش مصنوعی.
متن
فهرست ۲۰ بخش
حسین نظری
CTO زرینپال
- افزایش چشمگیر هزینههای زیرساخت ابری (۳ تا ۴ برابر شدن در ماههای اخیر) و ناپایداری مالی برای سازمانها
- چالشهای فنی و از دست رفتن چابکی در زیرساختهای خریداریشده قدیمی و مستهلک هنگام مهاجرت
- نیاز به افق دید ۳ تا ۵ ساله هنگام خرید سختافزار اختصاصی و تأثیر نوسانات ارزی بر توجیهپذیری اقتصادی
- موانع رگولاتوری بانکی (مانند الزامات شاپرک و بانک مرکزی) در استفاده از Cloud و تحمیل هزینههای مازاد
- اهمیت حیاتی تعریف چرخه عمر داده (Data Lifecycle) و Retention Policy برای کاهش هزینههای دیتابیس، لاگها و Object Storage
«هر چیزی را که از جنس دیتاست باید برایش Lifecycle از قبل تعیین بکنی.»
وحید محمدیان
CTO ارکید فارمد
- چالشهای شدید نگهداری دیتاسنتر داخلی در شرایط بحرانهای فیزیکی و نظامی و انتقال چندباره لایههای زیرساخت به فضاهای امنتر
- تجربه مهاجرت بخشی از سرویسها به ابر آروان جهت حفظ پایداری و تابآوری
- مشکلات و محدودیتهای همکاری با ارائهدهندگان بینالمللی نظیر Hetzner و AWS
شایان داورزنی
CTO اسبق باروک
- پیچیدگیهای اتصال به زیرساختهای سهامداران عمده (مانند بانکها) به دلیل فرآیندهای طولانی Deploy و الزامات رگولاتوری
- پیادهسازی معماری دوگانه: استقرار محیط Staging و Test روی Bare-Metal داخلی و نگهداری Production در بستر بانکی
- اولویتبخشی به چابکی (Agility) تیم توسعه در ابتدای مسیر راهاندازی کسبوکار
- استفاده از مدلهای ارزیابی ریسک و هوش مصنوعی بهصورت آفلاین جهت کاهش نرخ نکول بانکی
- اهمیت رعایت قوانین کشوری در خصوص نگهداری حداقل ۶ ماهه لاگهای تراکنشهای مالی جهت پاسخگویی حقوقی
محمدرضا گلستان
CTO خدمت از ما
- طرح دغدغه درباره نحوه مدیریت ناپایداریهای شبکه داخلی هنگام توزیع سرویسها میان چندین دیتاسنتر
- مقایسه پایداری زیرساختهای متمرکز اختصاصی در برابر مدلهای توزیعشده ابری
پرهام درویشی
لید معماری کارگزاری آگاه
- اتخاذ رویکرد Multi-Datacenter و Multi-Cloud با هدف دستیابی به Zero Downtime در سیستمهای مالی و معاملاتی
- اجرای مانورهای دورهای (ماهانه یا دوهفتهیکبار) برای ارزیابی تابآوری و انتقال سریع سرویسها
- راهاندازی و نگهداری زیرساخت مشابه PaaS توسط تیم داخلی برای افزایش پایداری و رضایت تیمهای توسعه و کاربران
- استفاده از معیارهای RPO و RTO و سطح اهمیت تجاری سرویسها برای تصمیمگیری در خصوص ایجاد معماری Active-Active یا Multi-Node
مهدیار مرادی
VP Engineering مجموعه داتوان
- تجربه مهاجرت از ابر آروان به دیتاسنتر اختصاصی و بررسی هزینهها در قالب FinOps
- کاهش شدید هزینهها در حوزه GPU (تا حدود یکچهارم) از طریق آفلود نگهداشتن منابع تا زمان دریافت Request و پیادهسازی سرویس بر مبنای Pay-As-You-Go
آرمین ایلدرمی
VP of Engineering بازار
- تحلیل Trade-off هزینهای در راهاندازی زیرساخت Active-Active میان چند دیتاسنتر در برابر پذیرش Downtime کنترلشده
- تصمیم آگاهانه سازمان برای نپذیرفتن هزینههای گزاف HA سراسری و مدیریت بحران در شرایط قطعیهای کمتکرار
امیرحسین حسینی آرانی
CTO جابویژن و نواتک
- انتخاب استراتژی تهیه Backupهای مطمئن Offsite بهجای پیادهسازی پرهزینه زیرساختهای Multi-Datacenter
- ضرورت شروع مسیر با سرویسهای ابری در ابعاد کوچک و مهاجرت به خرید سختافزار تنها در اسکیلهای اینترپرایز با بازگشت سرمایه کوتاهمدت
- لزوم تغییر افق برنامهریزیهای کلان زیرساختی از بازههای ۵ ساله به بازههای یکساله با توجه به متغیرهای ناپایدار محیطی
- تأکید بر بهینهسازی عملکرد نرمافزار و تمیزی کد (Code Optimization) بهعنوان گام نخست پیش از گسترش سختافزار
محمد مجیدی
CTO دستیار و هوشنگ
- تجربیات استفاده کامل از سرویسهای Cloud داخلی (نظیر همروش) در مقیاسهای کوچک
- ریسکهای وابستگی به داشبورد و کنترلپنل ارائهدهندگان در زمان وقوع قطعیهای سراسری دیتاسنترها
نیکنشان
CTO بیتمکس
- تعیین استراتژی بازیابی و HA بر اساس سطح تحمل Downtime از دید مشتری و ذینفعان (Acceptable Downtime)
- پیادهسازی معماری Active-Passive همراه با لاگشیپینگ (Log Shipping) برای بهینهسازی هزینهها
احمد سوری
مدیر فنی سابق دیجیکالا و فعال در حوزه استارتاپ
- نادیدهگرفتهشدن هزینههای پنهان نگهداری تیمهای فنی و تخصصی زیرساخت در شرکتها
- چالشهای رشد و ارزیابی نیروهای DevOps درونسازمانی در مقایسه با استفاده از ارائهدهندگان ابری
- آسیبپذیری لایههای DNS و CDN در اختلالات سراسری
علیرضا ملکی
چپتر لید فرانت اسنپتریپ
- آسیبهای سئو و هزینههای مارکتینگ ناشی از قطعی اینترنت بینالملل و ارائه راهحل پیادهسازی VM سبک خارج از ایران جهت Cache اطلاعات ایندکسپذیر
- نقدهای فنی به معماری App Router در Next.js و Server Components به دلیل قابلیت Cache پایین و تحمیل لود بالا و هزینههای مازاد بر زیرساخت
بهروز ترابی
مدیر زیرساخت و AI هلدینگ پگاه
- تفکیک رویکردها میان Disaster Recovery و FinOps و لزوم اتخاذ تصمیمهای متناسب با هر محصول
- استفاده ترکیبی از مزیتهای نسبی ارائهدهندگان مختلف ابری (استفاده از ستون/آروان برای پردازش، همروش برای DevOps، آسیاتک/کوبیت برای Storage)
پوریا افسری
CTO ماموت کانکت
- لزوم توجه به هزینههای انسانی راهاندازی و نگهداری سرویسهایی نظیر Load Balancer و فایروال درونسازمانی
- انتقال پردازشها به لبه شبکه (Edge Processing) در تجهیزات اینترنت اشیا جهت کاهش مصرف منابع سرور
- مدیریت سطح دقت و Granularity دادهها در طول زمان برای بهینهسازی مصرف حافظه ذخیرهسازی
بهراد زاری
منتور فنی و مدیر فنی سابق سازیتو
- بررسی لایههای مختلف کلود و تفاوت مدلهای Bare-metal، IaaS و PaaS در توزیع هزینهها
- تأکید بر اینکه بخش عمدهای از پایداری و High-Availability سیستم ناشی از معماری نرمافزار و طراحی سیستم است، نه صرفاً زیرساخت ابری
عارف
همبنیانگذار و CTO آرکپچر
- چالشهای پیادهسازی سیستمهای محافظت از Bot و DDoS با معماری Active-Passive و نسخه Lightweight
- لزوم سازگاری ارائهدهندگان ابری داخلی با استانداردهای Infrastructure as Code (مانند Terraform)
- انتقاد از مدلهای ناقص Pay-As-You-Go و عدم امکان Auto-Scaling لحظهای در نودهای Kubernetes ارائهدهندگان داخلی
مصطفی وکیلی
برنامهنویس ارشد مبنا
- پدید آمدن کلود بهدلیل چالشهای کمبود نیروی متخصص و هزینههای نگهداشت زیرساخت
- هزینههای نامشهود پهنای باند و انتقال دیتا داخل شبکه در کلودهای خارجی و عدم امکان دستیابی به Zero Downtime مطلق در دنیای واقعی
امیرعلی محمدی
توسعهدهنده سیستم
- استفاده از سختافزارهای SmartNIC و بازنویسی کد جهت پاسخگویی به درخواستهای همزمان بالا و کاهش مصرف برق و منابع سرور
- کاهش هزینههای ابری از طریق پیادهسازی نسخههای بهینهشده داخلی بهجای سرویسهای آماده
آناهیتا انصاری
معمار ارشد راهکار در ایرانسل
- ارتقای ۳۰ درصدی کارایی نرمافزارها از طریق ریفکتورینگ سالانه، بازنگری در ساختار سرویسها و Stateless کردن آنها
- پیادهسازی چارچوب Data Governance و تفکیک Cold Storage و Hot Database متناسب با نیاز ذینفعان
- دستهبندی سرویسها به Core Functionality و سرویسهای با ایمپکت بحرانی جهت حفظ پایداری در شرایط اضطراری
- ناکارآمدی برنامهریزیهای سالانه بلندمدت در فضای پرشتاب کسبوکارهای متکی به فناوری
گوینده ۱
- اهمیت مدیریت حافظه و کش کردن درخواستهای عمومی در مدلهای زبانی بزرگ (LLM)
- افزایش تصاعدی هزینههای سختافزاری متناسب با افزایش عمق پروژهها و انتظارات از دقت مدلها