インフラストラクチャの健全性の未来を発表
この記事では、インフラストラクチャの各コンポーネントにわたる稼働統計、ログ、構成データを相関させることで、主に人的ミスに起因するダウンタイムを削減するように設計された、インフラストラクチャの健全性を管理する新しいプラットフォームが発表されています。 この記事では、停止の70%以上が人的要因(時間的プレッシャー、ストレス、複雑さ、不適切な手順やインターフェース)に起因するという運用上の問題を説明し、同社の従来製品が実用的な洞察を提供することで、運用担当者が先手を打てるようにした経緯を紹介しています。 このプラットフォームはそのアプローチを拡張し、パートナーやユーザーがより多くのデバイスタイプに対して迅速にチェックを作成(将来的には機械学習によって作成されたチェックも利用可能)できるようにすることで、ネットワーク、セキュリティ、コンピューティング、ストレージ環境全体における稼働率を向上させます。
What specific operational problem is the new platform intended to solve?
The platform targets the high rate of outages caused by human error—over 70% according to the article—by addressing the root causes operators face daily: lack of time, stress, task complexity, insufficient training and procedures, poor human‑machine interaction, and thinly staffed teams. It solves this by collecting and correlating three information streams—running statistics, logs and configurations—then using on‑board knowledge to identify issues and recommend corrective action. The result is fewer firefights, earlier detection of problems, reduced operator stress, and reclaimed engineering time for higher‑value work.
How does the new platform differ from existing monitoring, log management, and configuration tools?
Unlike traditional tools that focus on a single element (monitoring, logs, or configuration) or that aggregate data but fail to correlate it meaningfully, the platform is designed to collect all three data types and apply on‑board knowledge to identify cross‑element conditions that require attention. The article emphasizes that many solutions either do not correlate these elements or lack the domain knowledge to know what to look for. The platform enables actionable alerts that point to root causes and remediation steps, turning reactive operators into proactive teams and substantially reducing incidents before they occur.
What are the next steps for the platform and how can organizations participate?
The company has built the platform to simplify authoring of checks for new infrastructure types; writing a specific check currently takes a few hours and is planned to drop to 30 minutes within six months. Machine learning teams are also developing automated systems to generate checks. The article outlines participation paths: customers should contact [email protected], channel and technology partners via [email protected], individuals contributing knowledge at [email protected], and R&D or San Francisco roles via the respective careers email addresses. The existing product will be migrated onto the platform over the coming year, with customers able to migrate initially without write capabilities.
本日、インフラストラクチャの健全性を管理する当社のプラットフォームを発表できることを大変嬉しく思います。具体的な内容に入る前に、まずその背景についてご説明させていただきます。
インフラストラクチャの健全性の現状はどのようになっていますか?
インフラ運用において、具体的に何が問題となっているのでしょうか?なぜ世界中の企業が依然としてダウンタイムに悩まされているのでしょうか?
当社および他社の調査によると、その原因は「人的要因」にあることが示されています。すべてのサービス停止の70%以上が人為的ミスによって引き起こされています。これは不可解なことです。インフラの運用を担当する人々は、世の中でも最も優秀な人材の一人だからです。 私は彼らと定期的に会いますが、彼らは自分の仕事を熟知しています。その多くは、10年以上の実務経験を持っています。それでも、ミスは起こります。なぜでしょうか?
数年前、米国エネルギー省傘下のアイダホ国立研究所は、エネルギー業界における人的ミスに関する短い論文を発表しました。異なる業界における人的ミスの類似性には驚かされます。同研究所は、人的ミスを引き起こすいくつかの重大な問題点を指摘しています:
- タスクを適切に完了するための時間が不足している。
- ストレス ― 身体的および精神的なもの。
- 当面の課題の複雑さ。
- 経験とトレーニング。
- 手順や業務プロセスの欠落、または不備。
- 人間と機械の相互作用(ユーザーインターフェースなど)が不十分。
- 体力(体調不良?疲れ?)
世界のデジタルインフラの円滑な運用を担う責任者の方々と話をすると、彼らがどれほど多くの異なるコンポーネントを管理しているかに驚かされます。例えば、ある管理者は、全米に分散する200以上のコンポーネントを、たった一人で管理しています。 彼女が利用できるのは、コンポーネントのいずれかに障害が発生した際にアラートを送信する基本的な監視システムだけです。さらに事態を困難にしているのは、これらのコンポーネントの一部がインターネット接続が遅く、理由もなくネットワークから切断されてしまうことです。 彼女にとって毎日が「火消し」のような日々であり、何が故障しているのかを突き止め、できるだけ早く修復しようと奮闘しています。彼女はストレスを抱え、時間不足、高い複雑さ、不十分なトレーニング、手順の欠如、(一部の製品における)使い勝手の悪いユーザーインターフェースといった状況下で業務をこなしており、おそらくかなり疲れていることでしょう。
このように、人間がミスを犯してしまう理由は明らかです。問題は、どうすれば彼らを支援できるかということです。

これまで多くのソフトウェア企業が、この課題への解決策を模索してきました。監視システム、ログ管理、さらには構成管理などです。しかし残念ながら、これらのシステムでは不十分です。サービスの中断やダウンタイムという問題に対して、実質的な改善をもたらすことはできません。これには3つの理由があります:
- これらのソリューションの多くは、インフラコンポーネントの健全性に関する要素のうち、稼働統計(モニタリング)、ログ、または設定のいずれか1つにのみ焦点を当てています。これら3つすべてを取得するものではありません。
- 3つの情報要素すべてを取り込んでいるソリューションもいくつかありますが、それらの相関関係を適切に分析できていません。特定の設定が、デバイスの故障を予見するのに役立ったはずのログに現れた問題を引き起こしたのでしょうか? そうしたソリューションは、ユーザーがその事実を突き止める手助けにはなりません。事前に気づくことも、事後的に把握することさえできないのです。
- Indeniのソリューションを除き、これらの3つの情報要素全体にわたって何を検出すべきかを実際に把握しているソリューションは存在しません。それらは収集したデータを提示することには優れていますが、その意味を理解するのは、(すでに過重な業務を抱え、手薄な状態にある)人間に委ねられています。
これまでどのような取り組みを行ってきたのでしょうか?
数年前、Indeniのチームはこの課題に対する解決策を考案しました。私たちは、インフラコンポーネントから稼働中の統計データ、ログ、設定情報を取得し、それらを分析・解釈できるソフトウェア製品を開発しました。この製品は、内蔵された知識を活用して注意が必要な箇所を特定し、ユーザーに対して必要な対応内容を通知するアラートを発信します。 最近、あるお客様がこうおっしゃっていました。「Indeniは問題が発生する前にそれを発見し、私に知らせてくれる」。これにより、世界のデジタルインフラを運用する人々は、突然、先手を打てるようになります。彼らは、先ほど述べた70%という数字を減らし、ゼロに近づけるためのチャンスを掴むことができるのです。 また、別の顧客は最近のアンケートで次のように語ってくれました。「Indeniを導入する前は、私のインフラは問題だらけでした。毎日電話がかかってきていました。Indeniを導入してからは、電話はほとんどかかってこなくなり、上司が気づく前に問題を処理できるようになりました。これにより、非常に多くの時間が確保できました。以前はエンジニアでしたが、今ではアーキテクトとして働いています。」
こうして、実験は成功しました。当社の技術は顕著な成果をもたらしました。顧客はこの技術に納得し、年間平均60%のペースで製品の利用を拡大しています。それだけでなく、当社の顧客は全員、競合他社は存在しないと述べています。複雑な問題が発生する前にそれを特定する能力において、当社の技術は他に類を見ません。
Indeniは、前述のように、人為的ミスの主な原因に対処しています:
- これにより、1人あたり月に数百人時間にも及ぶ時間を捻出し、手元の重要なプロジェクトに集中できるようになります。
- 組織内の他のメンバーが気付く前に問題を解決することで、精神的負担を大幅に軽減します。
- 当社は、問題の原因と適切な対処方法を特定することで、業務の複雑さを軽減します。
- トレーニングを充実させています。ユーザーがこれまで聞いたこともないような問題を指摘し、その解決方法をお教えします。
- 当社は業務プロセスの改善に取り組んでいます。特に、エンジニアリングチームと運用チーム間の連携、および運用チーム内での各エスカレーション段階における連携を最適化します。これにより、情報の引き継ぎがより円滑に行われるようになります。
- 私たちは管理者の背中を見守っています。メンテナンスウィンドウの制約により、午前2時に重要な変更が行われる場合でも、疲労した管理者によるミスが発生していないかを確認します。
しかし、これらはすべて、Check Pointのファイアウォール、Ciscoのスイッチ、F5のロードバランサー、およびPalo Alto Networksのファイアウォールに限定されていました。これは、世界全体のインフラストラクチャのほんの一部に過ぎません。

拡大の時
どんなに大きな企業であっても、考えられるあらゆる種類のインフラコンポーネントを網羅するという課題に、単独で対処することは不可能です。世界は広大です。そこには数兆ドル相当の機器が導入されています。その規模の大きさは、想像を絶するものです。
そこで、私たちはプラットフォームの構築を決定しました。3つのデータ要素(稼働統計、ログ、設定)を正しく収集し、それらを相関させる方法に関する当社の専門知識とノウハウをすべて結集しました。最初の製品を開発するために私たち自身が必要としていた機能をすべて備えた、堅牢なプラットフォームを構築したのです。 内部構造は複雑ですが、その魅力は、その上に簡単にアプリケーションを構築できる点にあります。現在、特定のインフラコンポーネントタイプにおける特定のエラーの可能性をチェックするコードを、当社の新しいプラットフォーム上で記述するのに数時間以下しかかかりません。今後6ヶ月間で、この時間を30分まで短縮する予定です。
さらに、当社の機械学習チームは、同じプラットフォーム上で独自のチェック機能を自動生成できるシステムを構築中です。コンピュータがコードを書くなんて! 想像を絶します。
これは、当社のプラットフォーム上で、世界中のあらゆるインフラストラクチャ(プライベート所有のものも、パブリッククラウドの一部であるものも問わず)に対して、高度にインテリジェントなチェックを作成できるようになることを意味します。

当社のプラットフォームにより、インフラ運用における人的ミスは過去のものとなります。
当社の最終目標
私たちの目標は、世界の大手企業すべてに当プラットフォームをご利用いただき、ネットワーク、セキュリティ、仮想化、コンピューティング、ストレージなど、インフラストラクチャ全体の稼働時間を確保することです。 その実現に向け、当社はお客様、パートナー、そしてより広範なコミュニティと緊密に連携してまいります。これは世界規模の取り組みであり、以下の担当者にメールにてご連絡いただき、ぜひご参加いただければ幸いです:
- お客様向け –[email protected]
- チャネルパートナー(VAR/VAD/DMR)およびテクノロジーパートナー –[email protected]
- 本プラットフォーム上で知見を提供したい方は、[email protected]までご連絡ください。
- イスラエルのチームに加わってくださる優秀な研究開発エンジニアを募集しています –[email protected]
- サンフランシスコのチームに加わってくださる営業担当者、SE、サポートエンジニア、IT専門家の方はこちらへ –[email protected]
私たち全員が協力し合うことで、インフラ運用はこれまでとは全く異なるものになるでしょう。
FAQ:現在の製品はどうなるのでしょうか?
Check Pointのファイアウォール、Ciscoのスイッチ、その他のデバイスにおける問題を特定できる現行製品は、今後1年間かけて、このプラットフォーム上で動作するよう移行されます。既存のお客様は、当面の間、プラットフォーム上に機能を追加する機能は利用できませんが、プラットフォームへの移行が可能となります。 Indeniの既存のお客様で、本プラットフォームのご利用にご興味をお持ちの方は、Indeniの担当者までご連絡ください。