تک تالک ششم: چالش‌های هزینه‌های Cloud و FinOps و مدیریت زیرساخت

خلاصه

نشست هم‌اندیشی مدیران فنی پیرامون چالش‌های FinOps، انتخاب میان Cloud و Bare-Metal، مدیریت Disaster Recovery، سیاست‌های Data Retention و بهینه‌سازی هزینه‌های هوش مصنوعی.

متن

فهرست ۲۰ بخش

حسین نظری

CTO زرین‌پال

  • افزایش چشمگیر هزینه‌های زیرساخت ابری (۳ تا ۴ برابر شدن در ماه‌های اخیر) و ناپایداری مالی برای سازمان‌ها
  • چالش‌های فنی و از دست رفتن چابکی در زیرساخت‌های خریداری‌شده قدیمی و مستهلک هنگام مهاجرت
  • نیاز به افق دید ۳ تا ۵ ساله هنگام خرید سخت‌افزار اختصاصی و تأثیر نوسانات ارزی بر توجیه‌پذیری اقتصادی
  • موانع رگولاتوری بانکی (مانند الزامات شاپرک و بانک مرکزی) در استفاده از Cloud و تحمیل هزینه‌های مازاد
  • اهمیت حیاتی تعریف چرخه عمر داده (Data Lifecycle) و Retention Policy برای کاهش هزینه‌های دیتابیس، لاگ‌ها و Object Storage

«هر چیزی را که از جنس دیتاست باید برایش Lifecycle از قبل تعیین بکنی.»

وحید محمدیان

CTO ارکید فارمد

  • چالش‌های شدید نگهداری دیتاسنتر داخلی در شرایط بحران‌های فیزیکی و نظامی و انتقال چندباره لایه‌های زیرساخت به فضاهای امن‌تر
  • تجربه مهاجرت بخشی از سرویس‌ها به ابر آروان جهت حفظ پایداری و تاب‌آوری
  • مشکلات و محدودیت‌های همکاری با ارائه‌دهندگان بین‌المللی نظیر Hetzner و AWS

شایان داورزنی

CTO اسبق باروک

  • پیچیدگی‌های اتصال به زیرساخت‌های سهام‌داران عمده (مانند بانک‌ها) به دلیل فرآیندهای طولانی Deploy و الزامات رگولاتوری
  • پیاده‌سازی معماری دوگانه: استقرار محیط Staging و Test روی Bare-Metal داخلی و نگهداری Production در بستر بانکی
  • اولویت‌بخشی به چابکی (Agility) تیم توسعه در ابتدای مسیر راه‌اندازی کسب‌وکار
  • استفاده از مدل‌های ارزیابی ریسک و هوش مصنوعی به‌صورت آفلاین جهت کاهش نرخ نکول بانکی
  • اهمیت رعایت قوانین کشوری در خصوص نگهداری حداقل ۶ ماهه لاگ‌های تراکنش‌های مالی جهت پاسخگویی حقوقی

محمدرضا گلستان

CTO خدمت از ما

  • طرح دغدغه درباره نحوه مدیریت ناپایداری‌های شبکه داخلی هنگام توزیع سرویس‌ها میان چندین دیتاسنتر
  • مقایسه پایداری زیرساخت‌های متمرکز اختصاصی در برابر مدل‌های توزیع‌شده ابری

پرهام درویشی

لید معماری کارگزاری آگاه

  • اتخاذ رویکرد Multi-Datacenter و Multi-Cloud با هدف دستیابی به Zero Downtime در سیستم‌های مالی و معاملاتی
  • اجرای مانورهای دوره‌ای (ماهانه یا دوهفته‌یک‌بار) برای ارزیابی تاب‌آوری و انتقال سریع سرویس‌ها
  • راه‌اندازی و نگهداری زیرساخت مشابه PaaS توسط تیم داخلی برای افزایش پایداری و رضایت تیم‌های توسعه و کاربران
  • استفاده از معیارهای RPO و RTO و سطح اهمیت تجاری سرویس‌ها برای تصمیم‌گیری در خصوص ایجاد معماری Active-Active یا Multi-Node

مهدیار مرادی

VP Engineering مجموعه دات‌وان

  • تجربه مهاجرت از ابر آروان به دیتاسنتر اختصاصی و بررسی هزینه‌ها در قالب FinOps
  • کاهش شدید هزینه‌ها در حوزه GPU (تا حدود یک‌چهارم) از طریق آفلود نگه‌داشتن منابع تا زمان دریافت Request و پیاده‌سازی سرویس بر مبنای Pay-As-You-Go

آرمین ایلدرمی

VP of Engineering بازار

  • تحلیل Trade-off هزینه‌ای در راه‌اندازی زیرساخت Active-Active میان چند دیتاسنتر در برابر پذیرش Downtime کنترل‌شده
  • تصمیم آگاهانه سازمان برای نپذیرفتن هزینه‌های گزاف HA سراسری و مدیریت بحران در شرایط قطعی‌های کم‌تکرار

امیرحسین حسینی آرانی

CTO جاب‌ویژن و نواتک

  • انتخاب استراتژی تهیه Backupهای مطمئن Offsite به‌جای پیاده‌سازی پرهزینه زیرساخت‌های Multi-Datacenter
  • ضرورت شروع مسیر با سرویس‌های ابری در ابعاد کوچک و مهاجرت به خرید سخت‌افزار تنها در اسکیل‌های اینترپرایز با بازگشت سرمایه کوتاه‌مدت
  • لزوم تغییر افق برنامه‌ریزی‌های کلان زیرساختی از بازه‌های ۵ ساله به بازه‌های یک‌ساله با توجه به متغیرهای ناپایدار محیطی
  • تأکید بر بهینه‌سازی عملکرد نرم‌افزار و تمیزی کد (Code Optimization) به‌عنوان گام نخست پیش از گسترش سخت‌افزار

محمد مجیدی

CTO دستیار و هوشنگ

  • تجربیات استفاده کامل از سرویس‌های Cloud داخلی (نظیر هم‌روش) در مقیاس‌های کوچک
  • ریسک‌های وابستگی به داشبورد و کنترل‌پنل ارائه‌دهندگان در زمان وقوع قطعی‌های سراسری دیتاسنترها

نیک‌نشان

CTO بیت‌مکس

  • تعیین استراتژی بازیابی و HA بر اساس سطح تحمل Downtime از دید مشتری و ذی‌نفعان (Acceptable Downtime)
  • پیاده‌سازی معماری Active-Passive همراه با لاگ‌شیپینگ (Log Shipping) برای بهینه‌سازی هزینه‌ها

احمد سوری

مدیر فنی سابق دیجی‌کالا و فعال در حوزه استارتاپ

  • نادیده‌گرفته‌شدن هزینه‌های پنهان نگهداری تیم‌های فنی و تخصصی زیرساخت در شرکت‌ها
  • چالش‌های رشد و ارزیابی نیروهای DevOps درون‌سازمانی در مقایسه با استفاده از ارائه‌دهندگان ابری
  • آسیب‌پذیری لایه‌های DNS و CDN در اختلالات سراسری

علیرضا ملکی

چپتر لید فرانت اسنپ‌تریپ

  • آسیب‌های سئو و هزینه‌های مارکتینگ ناشی از قطعی اینترنت بین‌الملل و ارائه راه‌حل پیاده‌سازی VM سبک خارج از ایران جهت Cache اطلاعات ایندکس‌پذیر
  • نقدهای فنی به معماری App Router در Next.js و Server Components به دلیل قابلیت Cache پایین و تحمیل لود بالا و هزینه‌های مازاد بر زیرساخت

بهروز ترابی

مدیر زیرساخت و AI هلدینگ پگاه

  • تفکیک رویکردها میان Disaster Recovery و FinOps و لزوم اتخاذ تصمیم‌های متناسب با هر محصول
  • استفاده ترکیبی از مزیت‌های نسبی ارائه‌دهندگان مختلف ابری (استفاده از ستون/آروان برای پردازش، هم‌روش برای DevOps، آسیاتک/کوبیت برای Storage)

پوریا افسری

CTO ماموت کانکت

  • لزوم توجه به هزینه‌های انسانی راه‌اندازی و نگهداری سرویس‌هایی نظیر Load Balancer و فایروال درون‌سازمانی
  • انتقال پردازش‌ها به لبه شبکه (Edge Processing) در تجهیزات اینترنت اشیا جهت کاهش مصرف منابع سرور
  • مدیریت سطح دقت و Granularity داده‌ها در طول زمان برای بهینه‌سازی مصرف حافظه ذخیره‌سازی

بهراد زاری

منتور فنی و مدیر فنی سابق سازیتو

  • بررسی لایه‌های مختلف کلود و تفاوت مدل‌های Bare-metal، IaaS و PaaS در توزیع هزینه‌ها
  • تأکید بر اینکه بخش عمده‌ای از پایداری و High-Availability سیستم ناشی از معماری نرم‌افزار و طراحی سیستم است، نه صرفاً زیرساخت ابری

عارف

هم‌بنیان‌گذار و CTO آرکپچر

  • چالش‌های پیاده‌سازی سیستم‌های محافظت از Bot و DDoS با معماری Active-Passive و نسخه Lightweight
  • لزوم سازگاری ارائه‌دهندگان ابری داخلی با استانداردهای Infrastructure as Code (مانند Terraform)
  • انتقاد از مدل‌های ناقص Pay-As-You-Go و عدم امکان Auto-Scaling لحظه‌ای در نودهای Kubernetes ارائه‌دهندگان داخلی

مصطفی وکیلی

برنامه‌نویس ارشد مبنا

  • پدید آمدن کلود به‌دلیل چالش‌های کمبود نیروی متخصص و هزینه‌های نگهداشت زیرساخت
  • هزینه‌های نامشهود پهنای باند و انتقال دیتا داخل شبکه در کلودهای خارجی و عدم امکان دستیابی به Zero Downtime مطلق در دنیای واقعی

امیرعلی محمدی

توسعه‌دهنده سیستم

  • استفاده از سخت‌افزارهای SmartNIC و بازنویسی کد جهت پاسخگویی به درخواست‌های هم‌زمان بالا و کاهش مصرف برق و منابع سرور
  • کاهش هزینه‌های ابری از طریق پیاده‌سازی نسخه‌های بهینه‌شده داخلی به‌جای سرویس‌های آماده

آناهیتا انصاری

معمار ارشد راهکار در ایرانسل

  • ارتقای ۳۰ درصدی کارایی نرم‌افزارها از طریق ریفکتورینگ سالانه، بازنگری در ساختار سرویس‌ها و Stateless کردن آن‌ها
  • پیاده‌سازی چارچوب Data Governance و تفکیک Cold Storage و Hot Database متناسب با نیاز ذی‌نفعان
  • دسته‌بندی سرویس‌ها به Core Functionality و سرویس‌های با ایمپکت بحرانی جهت حفظ پایداری در شرایط اضطراری
  • ناکارآمدی برنامه‌ریزی‌های سالانه بلندمدت در فضای پرشتاب کسب‌وکارهای متکی به فناوری

گوینده ۱

  • اهمیت مدیریت حافظه و کش کردن درخواست‌های عمومی در مدل‌های زبانی بزرگ (LLM)
  • افزایش تصاعدی هزینه‌های سخت‌افزاری متناسب با افزایش عمق پروژه‌ها و انتظارات از دقت مدل‌ها
فنیهزینهبهینه‌سازی