AI の安全性とコンテンツ基準
Boreon の中の AI が何をし、何をしないか。そしてそれを強制する3つの独立した層。実際に出荷されている挙動であり、目標ではありません。
更新
この文書は翻訳です。英語の原文が優先します。
このページが存在する理由
Boreon は職場のためのガバナンスソフトウェアを作っており、職場には人がいます。当社の AI がすることの大半は、データカタログを読んでガバナンス上の指摘の草案を書くことですが、同じアシスタントは、たまたま本当につらい一日を過ごしている誰かから、テキストボックスひとつ分しか離れていません。このページは、マーケティングの言葉を使わず平易に、当社の AI アシスタントが何をし、何をしないか、そしてその限界がどのように強制されるかを正確に記します。
このページのすべては、今日すでに構築され動作している挙動を記述しています。ここにあるものはどれもロードマップ上の項目や意図ではありません。検証できなかった限界は、掲載していません。
1. このページが扱う範囲
この文書は Boreon の中の AI 機能を扱います。スイート全体の助言アシスタントと、各統制アプリケーションのモデルを用いた機能で、製品のどちらのエディションも対象です。Boreon がホスト型の Cloud エディションとして動くか、自己ホスト型の Enterprise License として動くかにかかわらず、まったく同じように適用されます。安全設計は展開の仕方ではなく、ソフトウェア自体の中にあるからです。
このウェブサイトには、いかなる種類の AI 機能もありません。このドメインにチャットはなく、どこにもモデル呼び出しはなく、このサイトで入力したものが言語モデルに送られることは決してありません。プライバシー通知と Cookie ポリシーがそれぞれ独立にそう述べており、このページはそれらの主張を繰り返さず、指し示すだけです。
2. 第一に、そして最も重要なこと:危機にある人を機械に委ねることはありません
ある人が当社のアシスタントに、自殺や自傷を考えている、あるいは同僚がそうだと伝えた場合、アシスタントは直ちに停止します。助言も、診断も、慰めもせず、直前まで話していたデータ作業を続けることもしません。
アシスタントは、自分がガバナンスツールでありこれには力になれないこと、その人が本物の人間による支援を受けるに値することを明確に伝え、それを得られる具体的な場所を挙げます。地域の一般緊急番号、雇用主の人事チームまたは従業員支援プログラム、そして無料で秘密が守られる危機相談窓口です。国が分かる場合は、分類ではなく実際の番号を直接挙げます。米国では一般緊急の 911 と Suicide and Crisis Lifeline の 988、スイスと欧州連合では一般緊急の 112、スイスでは Die Dargebotene Hand の 143、18歳未満の相談者には 147 です。それ以外の地域では、実在する地域のサービスにつながる findahelpline.com を案内します。
言葉づかいより順序が重要な理由
この停止は、メッセージがどの AI モデルにも送られる「前」に起こります。この順序は意図的な設計上の選択であり、実装上の偶然ではありません。そしてこれこそが、この保証を希望ではなく確実なものとして述べられる理由です。
- このチェックは、AI の認証情報が解決される前、Tableau のコンテンツが読まれる前、トークンが1つでも消費される前に実行されるため、巧妙なプロンプト、ロールプレイの設定、会話の前のほうに隠された指示によって応答を言いくるめることはできません。モデルは、それを引き起こしたメッセージを決して見ないからです。
- モデルプロバイダーが遅い、レート制限されている、あるいは停止しているという理由で失敗することはありません。モデルが応答することにまったく依存していないからです。
- 管理者が設定するどんな項目によっても変更できません。この経路に届く設定が存在しないからです。
- 製品が提供するすべての言語で、毎回同じ応答です。モデルに行儀よく振る舞うよう頼むのではなく、ひとつの固定されたロジックだからです。
安全に応答することを選ぶモデルは、傾向にすぎません。モデルに何かを尋ねる前に実行されるコードは、性質です。この区別こそが、この節が意図の説明ではなく約束をできる理由のすべてです。
3. 何が語られたかは決して記録されません
この種の安全イベントは、区分とタイムスタンプとしてのみ記録され、それ以外は何も記録されません。人が実際に入力した言葉は、どのログにも書かれず、どの管理者にも見えず、どちらのエディションでも製品内のどこにも保持されません。
これは、顧客が通常のガバナンス作業のために、より詳細な AI 利用ログを有効にしている場合でも同じです。危機の経路は、そのログから単に伏字にされるのではなく、完全に除外されています。伏字は設定を誤る可能性がありますが、除外は書かれなかったものを漏らしようがないからです。
最悪の瞬間に助けを求めた人が、その後、自分の言葉が管理者の開くかもしれないコンソールに残っていることを心配する必要はありません。
4. 当社のアシスタントが決して生成しないもの
- いかなる種類の性的または猥褻な素材。
- 冒涜的な言葉、下品な表現、あるいは蔑称。
- 憎悪的、人種差別的、性差別的、同性愛嫌悪的、トランスジェンダー嫌悪的なコンテンツ、あるいは人種、宗教、性別、ジェンダー、性的指向、障害、年齢、国籍を理由に人を貶めるあらゆるもの。
- 実在の人物や企業に関する名誉毀損的または捏造された主張。偽のレビュー、虚偽の告発、でっち上げの引用を含みます。
- 嫌がらせ、脅迫、侮辱、威圧のメッセージ、あるいは誰かへのストーキングや個人情報の暴露への手助け。
- 暴力、武器、あるいは人を傷つけるための指示。
これらのいずれかを解除する設定は存在しません。冗談でも、テストでも、ロールプレイでも、仮定の話でも、管理者や Boreon が許可したという主張でも、制限そのものの分析として言い換えられた要求でも解除されません。この制限は、その前にあるモデルが説得されたかどうかにかかわらず実行されるコードによって強制されており、それを次の節が説明します。
5. 限界がどのように強制されるか:3つの独立した層
当社は、モデルが行儀よく振る舞うことを選ぶことに頼りません。3つの別々の仕組みがすべてのリクエストに適用され、それぞれは他の2つが完全に失敗しても機能するように作られています。
- 決定論的なスクリーニング、あらゆるモデル呼び出しの前に
- AI ではなく通常のコードが、最初にメッセージを読みます。認証情報が解決される前、データが読まれる前、トークンが消費される前に実行されるため、ここでの停止には何のコストもかからず、言いくるめて通り抜けることもできません。
- すべてのアシスタントに組み込まれた安全憲章
- スイートが提供するすべてのアシスタントの指示に書き込まれており、同じ会話の中で後から言われるどんなことよりも優先すると明記しています。固定された単語リストでは決して扱えない判断を担うのがこれです。
- 出力フィルター、何かが画面に届く前に
- モデルが何を生成したとしても、人が実際に読むテキストはすでに検査され、浄化されています。逸脱したモデルは、最初の2つの層がその原因となった要求について何も言うことがなかったとしても、ここで捕捉されます。
3つの層はすべて、スイート内のすべてのアシスタントが使うひとつの共有定義から生まれるため、どのアプリケーションも他より弱い保護のまま静かに出荷されることはなく、一度行った修正は同時にすべてに適用されます。
3つの層があるのは、それぞれの失敗の仕方が異なるからです。モデルは言い負かされることがあり、キーワードリストは言い回しで回避され、出力チェックは目新しいものを見逃すことがあります。ひとつの隙間を別の層の別種のチェックが覆うように3つを重ねることが、これをフィルターではなく壁と呼ぶ本当の理由です。
6. データプラットフォームには自らの語彙を知るルールが必要でした
汎用チャットボットのために作られた安全フィルターをガバナンス製品に向ければ、一日で役に立たなくなるでしょう。この分野の日常的な言葉は、文脈を離れると物騒に聞こえる単語で満ちているからです。固まったプロセスを kill する。セッションを terminate する。失敗した移行ジョブを abort する。テーブルを drop する。認証情報が dead になる。人口統計のデータソースには、まったく正当に Sex という名前の列があります。
だからこのシステムでは、単語ひとつで発火するルールはありません。すべてのルールは周囲の文と合わせて考慮される言い回しであり、プラットフォーム自身の語彙は、チェックがつまずく対象ではなく、認識するように作られている対象の一部です。
- 自殺という単語だけでは、何も止まりません。医療分野の顧客が接続している環境には、実際の列名として自殺リスクモデルが正当に存在しうるのであり、それを危機の告白として扱うことは誤りであるうえ、時間とともに、本物の警報を無視するよう人を慣らしてしまう類の誤報になります。
- 自傷のシグナルは、再帰的な目的語や自分自身についての願望の表明のような一人称の枠組みがあって初めて、描写ではなく告白として扱われます。
- 誰か他の人についての、より穏やかな心配、たとえば部下のひとりが苦しんでいるようだと管理職が書くような場合でも、停止に到達することは許容されています。チェックは、同僚への言及をすべて除外することではなく、その文が実際に何について述べているかを軸に作られています。
- 固まったジョブ、失敗したパイプライン、ソフトウェアについての暴力的な形をした文は、まさにそのようなものとして認識されます。動詞だけでなく、文の目的語がどのルールを適用するかを決めるからです。
これは双方向に、同じ基準で試験されています。実際の危害を検知できるかを検査し、人々がこの種の仕事について実際に話す言葉から採った実際の運用者の言葉も検査します。前者を捕捉できることだけを証明したシステムは後者について何も証明しておらず、誰かがそもそも製品を使えるかどうかを決めるのは後者です。
7. 苛立ちは違反ではありません
ひとつの意図的な設計上の決定は、率直に述べておく価値があります。抜け穴のように見えて、そうではないからです。誰かがアシスタントに悪態をついても、会話は打ち切られず、口調について説教されることもありません。
午前2時にストレスを抱えた運用者を罰するソフトウェアは、インシデントの最中に誰も頼れないソフトウェアです。壁で囲われているのは会話の当社側であって、相手側ではありません。アシスタント自身がそのような言葉を返すことは決してなく、冒涜的な言葉、蔑称、性的コンテンツを生成させる要求は、どのように届いたかにかかわらず拒否されます。保護は製品が発するものに向けられています。仕事を片付けようとして圧力の下にある人がどう表現するかには向けられていません。
8. 親切で、正確で、どちらも他方を犠牲にしない
当社のアシスタントは、温かく平易に話し、愛想の良さより先に正直であるよう指示されています。知らないことは知らないと言わなければなりません。製品が実際に読んだ実データに由来するのでない限り、数字を事実として提示してはなりません。答えを完全に見せるために、フィールド、権限、機能をでっち上げてはなりません。
ガバナンスツールにおける慰めになる誤った答えは、親切ではありません。それは敵対的な失敗とは別の、より静かな失敗であり、この製品はその両方に対して作られています。このサイトの保証パネルを実際に検証された事実まで遡れるように保っているのと同じ規律が、アシスタントがあなた自身のデータについて何を伝えてよいかを統制しています。
9. 当社のアシスタントの用途、そしてそれを告げて止まる場所
当社のアシスタントは、Tableau のガバナンス、ダッシュボード、データソース、セマンティックレイヤー、接続されたウェアハウス、リネージ、品質、移行、そしてこのスイートのアプリケーションがどう組み合わさるかを扱います。広い範囲ですが、それでも境界のある範囲です。
その範囲を大きく外れる話題については、アシスタントは親切にそう伝え、実際の根拠のない答えを試みる代わりに、実際に助けられることを提案します。医療、法律、金融、メンタルヘルスの助言は行いません。範囲外の話題について沈黙することの唯一の意図的な例外は第2節の危機対応であり、これは、限定的な拒否の代わりが最悪の瞬間の沈黙になってしまうからこそ存在しています。
10. あなたが有効にしない限り、プラットフォームの中に AI はありません
Boreon プラットフォームは既定で決定論的なエンジンで動作します。生成されるすべてのワークブック、すべての検証、すべてのリネージグラフ、すべてのガバナンスチェックは、モデルではなく通常の再現可能なコードによって生み出され、すべての統制アプリケーションは AI をまったく使わずに完全な結果を生成します。
AI 機能は組織が有効にするまでオフであり、有効にすると、その組織自身が用意するモデルプロバイダーのキーで動作します。自社ネットワーク内のプロキシにクライアントを向ける選択肢も含まれます。Boreon はキーを提供せず、モデルへのアクセスを再販せず、キーが提供されない限り、誰のためにも AI は動作しません。
AI が接続された Tableau 環境に書き込むことは決してありません。読み、説明し、提案することはできますが、提案したものはすべてカードとして届き、そのアプリケーション自身の承認関門に送られ、人が実行します。
この節はその形を述べるものであり、仕組みはそれぞれのためにすでに書かれた文書に属します。AI を有効にした後のデータの扱いについてはプライバシー通知を、ホスト型エディションでそれがどう統制されるかについてはデータ処理補遺を、AI 機能に適用される契約条件についてはライセンス契約を参照してください。
11. すべてのアカウントに、例外なく
Boreon は成人による業務利用を想定した職場向け製品であり、アカウントは組織自身の管理者が作成します。それでもなお、このページの基準は、すべてのエディションのすべてのアカウントに無条件で適用されます。
緩和モードも、フィルターなしの設定も、これらのいずれかをオフにする管理者スイッチもありません。どちらのエディションにも、アシスタントが第4節に挙げた素材を生成する構成は存在せず、第2節の危機対応を無効にできる構成も存在しません。
12. 当社の正直な限界
完璧なコンテンツフィルターは存在せず、このページは、どのシステムも実際には持たない完全性を主張するより、それを率直に述べることを選びます。
自動スクリーニングは原理上、異常に遠回しに表現された危害を見逃すことがあり、まったく無害だと分かる文でためらうことも時折あります。この2つ目の失敗の形こそが、第6節が存在する理由です。実際の運用上の言葉に対して試験されていないフィルターは、いずれ守るべき仕事の邪魔をし、それは製品に頼る人にとって、それ自体がひとつの害です。
アシスタントがこのページの基準に満たないものを生成した場合、あるいは明らかに止まるべきでないところで止まった場合は、当社に知らせてください。当社はその報告を、通常の製品フィードバックではなく安全システムの欠陥として扱い、修正し、修正された時点でそれを伝えます。
13. このページの変更
この文書の冒頭の日付は、最後に変更された日付です。基礎となる挙動が変わるとき、このページは製品の以前のバージョンを記述したまま放置されるのではなく、それに合わせて変わります。
このページは英語、日本語、ドイツ語、フランス語、イタリア語、ロシア語で公開されています。英語が原文であり、翻訳の意味が異なる場合は、この一連の他のすべての文書と同様に英語の文が優先します。
14. 連絡先
AI の安全性とコンテンツに関する懸念は legal@boreon.com にお寄せください。そこへの報告は、一般的な問い合わせ窓口に回されるのではなく、このシステムに責任を持つ人々が読みます。
プライバシーに関する質問、およびこの法的文書群の他の場所で扱われる事項は、通常どおり privacy@boreon.com にお寄せください。