Практические разборы l1_use_cases
Kimi K3 против ChatGPT: 5 реальных файлов и 9 проверок
Kimi K3 и ChatGPT получают один и тот же рабочий бриф, CSV и набор проверенных фактов. Обе модели должны собрать анализ, бюджет, презентацию, лендинг и JSON-отчёт. Мы сохраняем сырые ответы, автоматически проверяем девять требований, открываем результат в браузере на компьютере и телефоне, воспроизводим сбой и исправляем мобильную вёрстку.
Видео по теме
Kimi K3 и ChatGPT получают один и тот же рабочий бриф, CSV и набор проверенных фактов. Обе модели должны собрать анализ, бюджет, презентацию, лендинг и JSON-отчёт. Мы сохраняем сырые ответы, автоматически проверяем девять требований, открываем результат в браузере на компьютере и телефоне, воспроизводим сбой и исправляем мобильную вёрстку.
Таймкоды
- 00:00 Результат до объяснений
- 00:18 Что проверяем
- 01:21 Официальные возможности Kimi
- 02:39 Одинаковый вход для двух моделей
- 05:12 Реальные запуски и пять файлов
- 10:04 Сбой, конфликт бюджета и скрытые ошибки
- 12:04 Как устроен воспроизводимый benchmark
- 15:23 Сломанная мобильная версия и repair
- 18:41 Девять автоматических проверок
- 20:28 Результаты в браузере
- 23:49 Кому подходит Kimi, а кому ChatGPT
- 24:20 Как повторить тест
Shorts
Источники выпуска
Исходники проекта из выпуска
Это тот же воспроизводимый проект, который собирается и тестируется в видео.
brief.md— Conflicting launch briefsurvey.csv— Survey fixturesource_pack.json— Controlled competitor factsprompt.txt— Identical provider promptbenchmark_runner.py— Real provider executionverify.py— Deterministic output verifierrequirements.txt— Pinned runtimeREADME.md— Reproduction instructions
Команды запуска и проверки
.venv/bin/python benchmark_runner.py
.venv/bin/python verify.py
Практический материал из выпуска
Артефакт: Two materialized launch packages plus deterministic verifier.
Что должно получиться: Brief, survey, prompt, outputs, scoreboard and project ZIP.
Видимый результат: Browser shows both presentations and landing pages; terminal shows factual scores.
Вход для демо: One conflicting launch brief, survey CSV and source pack.
Выход демо: Analysis, budget, seven-slide presentation, responsive site and summary from each model.
Проверка результата: Parser checks ten factual and functional requirements for each provider.
Как собрать
- inspect input
- run both models
- materialize files
- verify calculations
- open slides
- test site
- score limits
- input
- provider run
- materialization
Чеклист перед пилотом
- both packages exist
- survey math
- budget conflict
- no invented price
- seven slides
- working responsive form
- both launch packages materialized
- scoreboard generated
- browser outputs open
Примеры команд, настроек или правил
benchmark_runner.py
verify.py
prompt.txt
brief.md
survey.csv
source_pack.json
requirements.txt
README.md
env CODEVIBERS_ROOT=/Users/urij/Documents/Развитие .venv/bin/python benchmark_runner.py
.venv/bin/python benchmark_runner.py
Требования и рекомендации
Требования
- identical prompt
- preserved raw output
- desktop and mobile review
Рекомендации
- зафиксировать одинаковый вход
- проверить расчёты автоматически
- открыть каждый пользовательский файл
Суть темы
Kimi K3 и ChatGPT получают один и тот же рабочий бриф, CSV и набор проверенных фактов. Обе модели должны собрать анализ, бюджет, презентацию, лендинг и JSON-отчёт. Мы сохраняем сырые ответы, автоматически проверяем девять требований, открываем результат в браузере на компьютере и телефоне, воспроизводим сбой и исправляем мобильную вёрстку.
Что важно забрать
- Repeat the benchmark with the downloadable fixture pack.
- Одинаковая реальная задача, проверяемые файлы и честный победитель без пересказа пресс-релиза.
- Kimi K3 and ChatGPT create files that are parsed, opened and tested rather than subjectively reviewed.
- Replace subjective AI reviews with identical inputs, deterministic checks and physical browser review.
Как применять на практике
Используйте материал как отправную точку: сформулируйте задачу, ограничьте область применения, выберите метрику качества и проверьте результат на небольшом сценарии до внедрения в production.
Практические шаги
- inspect input
- run both models
- materialize files
- verify calculations
- open slides
- test site
- score limits
- input
Рекомендации
- зафиксировать одинаковый вход
- проверить расчёты автоматически
- открыть каждый пользовательский файл
Требования и ограничения
- identical prompt
- preserved raw output
- desktop and mobile review
Примеры
- budget conflict detection
- responsive landing form
Антипримеры
- declaring a winner from a pretty first screenshot
Как проверить готовность
- nine deterministic assertions
- successful form state on desktop and mobile
Навигация по выпуску
- 00:00 Результат до объяснений
- 00:18 Что проверяем
- 01:21 Официальные возможности Kimi
- 02:39 Одинаковый вход для двух моделей
- 05:12 Реальные запуски и пять файлов
- 10:04 Сбой, конфликт бюджета и скрытые ошибки
- 12:04 Как устроен воспроизводимый benchmark
- 15:23 Сломанная мобильная версия и repair
- 18:41 Девять автоматических проверок
- 20:28 Результаты в браузере
- 23:49 Кому подходит Kimi, а кому ChatGPT
- 24:20 Как повторить тест