Безопасность ИИ и стандарты содержимого
Что ИИ внутри Boreon будет и не будет делать, и три независимых уровня, которые это обеспечивают. Реализованное поведение, а не стремление.
Обновлено
Этот документ является переводом. Английский текст имеет преимущественную силу.
Зачем существует эта страница
Boreon создаёт программное обеспечение для управления на рабочих местах, а на рабочих местах есть люди. Большая часть того, что делает наш ИИ, это чтение каталога данных и подготовка черновика вывода по управлению, но тот же самый помощник находится в одном текстовом поле от любого, у кого сегодня по-настоящему плохой день. Эта страница прямо и без маркетингового языка излагает, что наши ИИ-помощники будут и не будут делать, и как именно эти границы обеспечиваются.
Всё на этой странице описывает поведение, которое реализовано и работает сегодня. Ничто здесь не является пунктом плана или намерением. Там, где границу не удалось проверить, она не напечатана.
1. Что охватывает эта страница
Этот документ охватывает функции ИИ внутри Boreon: консультативного помощника всего комплекса и функции отдельных управляемых приложений, основанные на моделях, в любой из редакций продукта. Он применяется одинаково, работает ли Boreon как размещаемая редакция Cloud или как самостоятельно размещаемая Enterprise License, потому что архитектура безопасности живёт в самом программном обеспечении, а не в способе его развёртывания.
На этом сайте нет никаких функций ИИ. На этом домене нет чата, нигде в нём нет вызова модели, и ничто из того, что вы вводите на этом сайте, никогда не отправляется языковой модели. Уведомление о конфиденциальности и политика в отношении файлов cookie независимо друг от друга говорят об этом, и эта страница не повторяет их утверждения, а лишь указывает на них.
2. Прежде всего и важнее всего: никто в кризисе не передаётся машине
Если человек сообщает одному из наших помощников, что думает о самоубийстве или самоповреждении, или что об этом думает коллега, помощник немедленно останавливается. Он не консультирует, не ставит диагноз, не успокаивает и не продолжает работу с данными, которая обсуждалась мгновение назад.
Он ясно говорит, что является инструментом управления и не может помочь в этом, что человек заслуживает настоящей человеческой поддержки, и называет конкретные места, где её получить: местный общий номер экстренной помощи, собственную HR-службу работодателя или программу помощи сотрудникам, и бесплатную конфиденциальную кризисную линию. Там, где страна известна, он называет реальные номера напрямую, а не категорию: 911 для общей экстренной помощи в США и 988 для Suicide and Crisis Lifeline; 112 для общей экстренной помощи в Швейцарии и Европейском союзе, и 143 в Швейцарии для Die Dargebotene Hand, с 147 для звонящих младше восемнадцати лет. Везде в остальных случаях он указывает на findahelpline.com, который ведёт к реальной местной службе.
Почему порядок важнее формулировки
Эта остановка происходит ДО того, как сообщение вообще отправляется какой-либо модели ИИ. Такой порядок является осознанным проектным решением, а не случайностью реализации, и именно поэтому эта гарантия может быть заявлена как уверенность, а не как надежда.
- Проверка выполняется до того, как разрешаются учётные данные ИИ, до чтения какого-либо содержимого Tableau и до того, как потрачен хотя бы один токен, поэтому ответ нельзя обойти хитрым запросом, ролевой игрой или инструкцией, спрятанной ранее в разговоре, потому что модель никогда не видит сообщение, которое её вызвало.
- Она не может отказать из-за того, что провайдер модели медленный, ограничен по частоте запросов или недоступен, потому что ничто в ней не зависит от ответа модели вообще.
- Её нельзя изменить ничем из того, что настраивает администратор, потому что нет настройки, которая достигает этого пути.
- Это один и тот же ответ каждый раз, на каждом языке, с которым поставляется продукт, потому что это один фиксированный фрагмент логики, а не просьба к модели вести себя хорошо.
Модель, которая решает ответить безопасно, это тенденция. Код, который выполняется до того, как модели вообще что-либо задано, это свойство. Это различие и есть вся причина, по которой этот раздел может что-то обещать, а не просто описывать намерение.
3. Сказанное никогда не записывается
Событие безопасности такого рода записывается как категория и отметка времени, и ничего больше. Слова, которые человек на самом деле набрал, не записываются ни в один журнал, не видны ни одному администратору и нигде в продукте не хранятся, ни в одной из редакций.
Это верно даже там, где заказчик включил более подробное журналирование использования ИИ для обычной работы по управлению. Кризисный путь полностью исключён из этого журналирования, а не просто скрыт в нём, потому что скрытие можно настроить неправильно, а исключение не может выдать то, чего оно никогда не записывало.
Человеку, обратившемуся в свой худший момент, не приходится затем беспокоиться, что его слова лежат в консоли, которую может открыть администратор.
4. Чего наши помощники никогда не создадут
- Сексуальные или порнографические материалы любого рода.
- Ненормативную лексику, грубость или оскорбительные прозвища.
- Ненавистнический, расистский, сексистский, гомофобный или трансфобный контент, или что-либо, унижающее человека за его расу, религию, пол, гендер, сексуальность, инвалидность, возраст или национальность.
- Клеветнические или выдуманные утверждения о реальном человеке или компании, включая поддельные отзывы, ложные обвинения и вымышленные цитаты.
- Преследующие, угрожающие, унизительные или запугивающие сообщения, или помощь в преследовании или раскрытии личных данных кого-либо.
- Инструкции по насилию, оружию или причинению вреда человеку.
Нет никакой формулировки, которая разблокирует что-либо из этого. Ни шутка, ни тест, ни ролевая игра, ни гипотеза, ни утверждение, что администратор или Boreon это разрешили, ни запрос, сформулированный как анализ самого ограничения. Ограничение обеспечивается кодом, который выполняется независимо от того, убеждена ли стоящая перед ним модель, и именно это объясняет следующий раздел.
5. Как обеспечиваются границы: три независимых уровня
Мы не полагаемся на то, что модель решит вести себя правильно. Три отдельных механизма применяются к каждому запросу, и каждый построен так, чтобы работать, даже если два других полностью откажут.
- Детерминированная проверка, до любого вызова модели
- Обычный код, а не ИИ, читает сообщение первым. Он выполняется до разрешения каких-либо учётных данных, до чтения каких-либо данных и до траты какого-либо токена, поэтому остановка здесь ничего не стоит, и её нельзя обойти уговорами.
- Хартия безопасности внутри каждого помощника
- Записана в инструкции каждого помощника, поставляемого с комплексом, и прямо заявляет, что стоит выше всего, сказанного позже в том же разговоре. Именно она покрывает суждения, которые фиксированный список слов никогда бы не покрыл.
- Фильтр вывода, прежде чем что-либо попадёт на экран
- Что бы ни произвела модель, текст, который человек на самом деле читает, уже проверен и очищен. Модель, которая отклонилась, перехватывается здесь, даже если первым двум уровням нечего было сказать о запросе, который это вызвал.
Все три уровня происходят из одного общего определения, используемого каждым помощником в комплексе, поэтому ни одно приложение не может незаметно выйти с более слабой защитой, чем остальные, а исправление, сделанное один раз, применяется везде сразу.
Три уровня существуют потому, что каждый отказывает по-своему. С моделью можно спорить; список ключевых слов можно обойти формулировкой; проверка вывода может пропустить что-то новое. Наложение трёх уровней, так что пробел в одном покрывается проверкой другого рода в другом, и есть настоящая причина, по которой это называется стеной, а не фильтром.
6. Платформе данных нужны были правила, знающие её собственный словарь
Фильтр безопасности, построенный для универсального чат-бота и направленный на продукт для управления, стал бы бесполезен в течение дня, потому что обычный язык этой области полон слов, которые вне контекста звучат тревожно. Вы убиваете зависший процесс. Вы завершаете сессию. Вы прерываете неудавшееся задание миграции. Вы удаляете таблицу. Учётные данные умирают. Демографический источник данных совершенно законно содержит столбец с именем Пол.
Поэтому ни одно правило в этой системе не срабатывает на голое слово. Каждое правило, это выражение, рассматриваемое вместе с окружающим его предложением, и собственный словарь платформы является частью того, что проверка построена распознавать, а не спотыкаться об него.
- Слово самоубийство само по себе никогда ничего не останавливает. Собственная подключённая среда заказчика из сферы здравоохранения может законно содержать модель суицидального риска в качестве реального имени столбца, и трактовать это как кризисное признание было бы и неверно, и со временем стало бы тем видом ложной тревоги, который приучает людей игнорировать настоящую.
- Сигналу о самоповреждении нужна рамка первого лица, такая как возвратное дополнение или высказанное желание о самом себе, прежде чем он будет расценен как признание, а не как описание.
- Более мягкое беспокойство о ком-то другом, например, когда руководитель пишет, что один из его подчинённых, похоже, испытывает трудности, всё же может дойти до остановки: проверка построена вокруг того, о чём предложение на самом деле, а не вокруг исключения любого упоминания коллеги.
- Предложение с формой насилия о зависшем задании, неудавшемся конвейере или программе распознаётся именно как таковое, потому что объект предложения, а не только глагол, решает, какое правило применяется.
Это проверяется в обоих направлениях и по одному и тому же стандарту: проверяются реальные вредные случаи, и проверяется также реальный язык операторов, взятый из того, как люди на самом деле говорят о такой работе. Система, которая лишь доказывает, что может поймать первое, ничего не доказала о втором, а именно второе решает, сможет ли кто-либо вообще пользоваться продуктом.
7. Раздражение не является нарушением
Одно осознанное проектное решение заслуживает открытого упоминания, потому что оно выглядит как пробел, но им не является. Если кто-то ругается на помощника, разговор не прерывается, и человеку не читают нотаций о его тоне.
Программное обеспечение, которое наказывает измотанного оператора в два часа ночи, это программное обеспечение, на которое никто не может положиться во время инцидента. Ограждена наша сторона разговора, а не их: сам помощник никогда не использует такой язык в ответ, а запрос, требующий от него произвести ненормативную лексику, оскорбления или сексуальный контент, отклоняется независимо от того, как запрос поступил. Защита направлена на то, что выдаёт продукт. Она не направлена на то, как человек под давлением выражается, пытаясь сделать свою работу.
8. Доброжелательно и точно, и ни одно не за счёт другого
Нашим помощникам предписано быть тёплыми и говорить просто, и быть честными прежде, чем угодливыми. Они обязаны сказать, когда чего-то не знают. Они не должны представлять число как факт, если оно не пришло из реальных данных, которые продукт действительно прочитал. Они не должны выдумывать поле, право или возможность, чтобы ответ казался полным.
Утешительный неверный ответ в инструменте управления, это не доброта. Это иной, более тихий отказ, чем враждебный, и этот продукт построен против обоих. Та же дисциплина, которая удерживает панель гарантий на этом сайте прослеживаемой до реального, проверенного факта, определяет, что помощнику разрешено рассказывать вам о ваших собственных данных.
9. Для чего нужны наши помощники, и где они говорят об этом и останавливаются
Наши помощники охватывают управление Tableau, дашборды, источники данных, семантический слой, подключённые хранилища, происхождение данных, качество и миграцию, а также то, как приложения этого комплекса сочетаются друг с другом. Это широкая область, и всё же она ограничена.
По теме, далеко выходящей за эти рамки, помощник доброжелательно говорит об этом и вместо этого предлагает то, с чем действительно может помочь, а не пытается дать ответ, для которого у него нет реальной основы. Он не даёт медицинских, юридических, финансовых советов и советов по психическому здоровью. Единственное осознанное исключение из молчания по теме вне его рамок, это кризисный ответ из раздела два, который существует именно потому, что альтернативой ограниченному отказу там было бы молчание в худший из возможных моментов.
10. Внутри платформы нет ИИ, пока вы его не включите
Платформа Boreon по умолчанию работает на детерминированных механизмах. Каждая книга, которую она создаёт, каждая проверка, каждый граф происхождения данных и каждая проверка управления производятся обычным, воспроизводимым кодом, а не моделью, и каждое управляемое приложение выдаёт свой полный результат вообще без ИИ.
Функции ИИ выключены, пока организация их не включит, и тогда они работают на ключе провайдера модели, который эта организация предоставляет сама, включая возможность направить клиент на прокси внутри собственной сети. Boreon не предоставляет ключей, не перепродаёт доступ к моделям, и никакой ИИ не работает от чьего-либо имени без предоставленного ключа.
ИИ никогда не пишет в подключённую среду Tableau. Он может читать, объяснять и предлагать, и всё, что он предлагает, приходит в виде карточки, направляемой в собственный шлюз одобрения этого приложения, где действие выполняет человек.
Этот раздел описывает общую форму; механика принадлежит документам, уже написанным для неё. См. уведомление о конфиденциальности о том, что происходит с данными после включения ИИ, дополнение об обработке данных о том, как это регулируется в размещаемой редакции, и лицензионное соглашение о договорных условиях, применимых к функциям ИИ.
11. Каждая учётная запись, без исключений
Boreon, это продукт для рабочего места, предназначенный для делового использования взрослыми, и учётные записи создаются собственными администраторами организации. Стандарты этой страницы тем не менее применяются безусловно, к каждой учётной записи, в каждой редакции.
Нет ослабленного режима, нет нефильтрованной настройки и нет переключателя администратора, который отключает что-либо из этого. Не существует конфигурации этого продукта, ни в одной из редакций, в которой помощник произведёт материалы, перечисленные в разделе четыре, и нет конфигурации, в которой кризисный ответ из раздела два может быть отключён.
12. Наши честные пределы
Ни один фильтр содержимого не совершенен, и эта страница предпочитает сказать это прямо, чем заявлять о полноте, которой на самом деле не обладает ни одна система.
Автоматическая проверка может, в принципе, пропустить вред, выраженный необычно косвенным образом, и может иногда замешкаться на предложении, которое оказывается совершенно невинным. Этот второй вид отказа и есть причина существования раздела шесть: фильтр, не проверенный на реальном рабочем языке, рано или поздно помешает работе, которую он должен защищать, а это свой собственный вид вреда для человека, полагающегося на продукт.
Если помощник произвёл что-то, не соответствующее стандартам этой страницы, или остановился там, где явно не должен был, сообщите нам. Мы рассматриваем такое сообщение как дефект в системе безопасности, а не как обычный отзыв о продукте, и мы исправим его и скажем, когда он исправлен.
13. Изменения этой страницы
Дата в начале этого документа является датой его последнего изменения. Когда меняется лежащее в основе поведение, эта страница меняется вместе с ним, а не остаётся описывать более раннюю версию продукта.
Эта страница опубликована на английском, японском, немецком, французском, итальянском и русском языках. Английский является оригиналом, и там, где перевод расходится по смыслу, действует английский текст, точно так же, как для любого другого документа в этом наборе.
14. Контакты
Вопросы безопасности ИИ и содержимого направляйте на legal@boreon.com. Сообщение туда читают люди, ответственные за эту систему, а не складывают в общую очередь.
Вопросы о конфиденциальности и всё остальное, что рассмотрено в других местах этого юридического набора, направляйте, как обычно, на privacy@boreon.com.