# Как проверить модель: готовые промпты CHI/CHIS v0.1

Модель должна решить одинаковые задания. Оценку считает отдельный скрипт по заранее заданным ответам. Просьба «прочитай статью и назови свой CHI» такой проверкой не является.

## Быстрая проверка — 6 обращений

1. В новом чистом чате отправьте `quick-prompts/01-memory-encode.txt`. Сохраните ответ — это заметки модели.
2. В ДРУГОМ новом чате отправьте `02-memory-probe-TEMPLATE.txt`, заменив метку на заметки из первого ответа. Передаются только заметки, не исходные записи. Лимит — 6000 байт UTF-8; скрипт ниже применит его точно.
3. В новом чате отправьте `03-empty-notebook.txt` — те же вопросы без заметок.
4. В новом чате отправьте `04-full-evidence.txt` — контроль с полными исходными записями.
5. В новом чате отправьте `05-task-panel-A.txt`.
6. В новом чате отправьте `06-task-panel-B.txt`.

Каждый файл — отдельное обращение. Отключите память приложения, персональные инструкции, поиск и инструменты, если это доступно; запишите недоступные настройки. Новый чат сам по себе не гарантирует отключения памяти аккаунта. Не давайте модели весь ZIP: там есть ключи ответов. Не просите её проверить себя. Сохраняйте ответы целиком, без исправлений и повторных попыток.

## Скрипт избавляет от ручной сборки промптов

Нужен Python 3.10 или новее, дополнительных библиотек и API-ключей не нужно. Откройте терминал в распакованной папке:

```text
python manual.py init --run runs/fable --model "Claude Fable 5.1" --settings "Укажите приложение, дату, reasoning, лимит ответа, память, инструменты; неизвестное так и обозначьте" --seed 18001 --suite quick
python manual.py next --run runs/fable
```

Скрипт создаст `runs/fable/next-prompt.txt`. Отправьте только его содержимое в новый чат. Сохраните полный ответ в `answer.txt` и выполните:

```text
python manual.py record --run runs/fable --response answer.txt --status ok
python manual.py next --run runs/fable
```

Повторите шесть раз, затем:

```text
python manual.py score --run runs/fable
```

Получите `runs/fable/report.json`. Нормально завершённый неправильный ответ всё равно записывается как `ok`: правильность проверяет скрипт. Для обрезанного ответа используйте `output_limit`, для явного отказа — `refused`, для ошибки интерфейса — `error`. Ничего не переписывайте задним числом.

## Расширенный режим — 39 обращений

Создайте другую папку, заменив `--suite quick` на `--suite full`. Скрипт добавит память при 32/64/128/256 фактах и три ветви истории с пятью контрольными точками. Он сам переносит только допустимые заметки; ответы на контрольные вопросы не попадают в дальнейшую память. Получатся кривая памяти, EIMC и короткая последовательность поведения CHIS-style.

Для другой модели используйте другую папку, тот же seed и тот же режим. Для повторов меняйте seed одинаково у всех моделей. Один seed — один независимый набор; десятки вопросов внутри него не заменяют десятки независимых повторов.

## Что получится

- Качество памяти Q_M: число от 0 до 1; умножив на 100, получим шкалу 0–100.
- Отдельные баллы небольших заданий R/C/A/I, без притворства, что это полный профиль.
- В полном режиме — изменения ответов во времени и при разных историях.
- CHI остаётся `null`: человеческая калибровка пока отсутствует. Из этих баллов нельзя честно получить «102,3 CHI» или процент сознания.

Это открытый пилотный набор v0.1, а не валидированный психологический стандарт. Ручные результаты и результаты API-прогона на сайте — разные условия; их нельзя незаметно смешивать. Короткий режим не измеряет CHIS и EIMC. Подробности, ограничения и лицензии — в README.md.
