Для тех, кто поручает ИИ изменения в коде. Результат этой проверки — запись, сколько времени заняли задача, помощь агенту и исправления. Нужны тестовая копия проекта без секретов, привычная проверка результата и ограничение времени. Проверено по источнику 7 сентября 2026 года.
В публикации от 6 сентября OpenAI сообщает: за рассматриваемые шесть месяцев более половины успешных задач, оценённых в 4–8 часов человеческой работы, потребовали хотя бы одного вмешательства человека. Это оценка сложности, а не время непрерывной автономной работы агента. Компания называет измерения предварительными; результаты своей исследовательской команды нельзя автоматически переносить на вашу работу.
Ниже — предлагаемый редакцией протокол, а не проведённый XC7 эксперимент и не методика OpenAI.
Одна строка на попытку: задача → принята или нет → общее время → ваше активное время → число вмешательств → переделки → расход, если он известен.
Сравните несколько сопоставимых задач с контрольными прогонами обычным способом. Повторение уже решённой задачи и разная сложность искажают сравнение. Один удачный пример показывает возможность, но не доказывает устойчивую экономию.
Не считайте строки кода полезным результатом и не исключайте неудачные попытки из записей. Если расход недоступен, так и укажите — не подставляйте оценку как факт. Остановите прогон при достижении лимита или запросе лишних прав; не ослабляйте ограничения ради завершения.
Откат: не переносите непроверенные изменения в основной проект. Сохраните запись результата и восстановите только тестовую копию из исходного снимка. Рабочие данные этот тест затрагивать не должен.
Проверяемые источники
Комментариев пока нет