Практические разборы l1_use_cases

Kimi K3 против ChatGPT: 5 реальных файлов и 9 проверок

Kimi K3 и ChatGPT получают один и тот же рабочий бриф, CSV и набор проверенных фактов. Обе модели должны собрать анализ, бюджет, презентацию, лендинг и JSON-отчёт. Мы сохраняем сырые ответы, автоматически проверяем девять требований, открываем результат в браузере на компьютере и телефоне, воспроизводим сбой и исправляем мобильную вёрстку.

Видео по теме

Открыть видео на YouTube

Kimi K3 и ChatGPT получают один и тот же рабочий бриф, CSV и набор проверенных фактов. Обе модели должны собрать анализ, бюджет, презентацию, лендинг и JSON-отчёт. Мы сохраняем сырые ответы, автоматически проверяем девять требований, открываем результат в браузере на компьютере и телефоне, воспроизводим сбой и исправляем мобильную вёрстку.

Таймкоды

  • 00:00 Результат до объяснений
  • 00:18 Что проверяем
  • 01:21 Официальные возможности Kimi
  • 02:39 Одинаковый вход для двух моделей
  • 05:12 Реальные запуски и пять файлов
  • 10:04 Сбой, конфликт бюджета и скрытые ошибки
  • 12:04 Как устроен воспроизводимый benchmark
  • 15:23 Сломанная мобильная версия и repair
  • 18:41 Девять автоматических проверок
  • 20:28 Результаты в браузере
  • 23:49 Кому подходит Kimi, а кому ChatGPT
  • 24:20 Как повторить тест

Shorts

Источники выпуска

Исходники проекта из выпуска

Это тот же воспроизводимый проект, который собирается и тестируется в видео.

  • brief.md — Conflicting launch brief
  • survey.csv — Survey fixture
  • source_pack.json — Controlled competitor facts
  • prompt.txt — Identical provider prompt
  • benchmark_runner.py — Real provider execution
  • verify.py — Deterministic output verifier
  • requirements.txt — Pinned runtime
  • README.md — Reproduction instructions

Команды запуска и проверки

.venv/bin/python benchmark_runner.py
.venv/bin/python verify.py

Скачать проект ZIP

Практический материал из выпуска

Артефакт: Two materialized launch packages plus deterministic verifier.

Что должно получиться: Brief, survey, prompt, outputs, scoreboard and project ZIP.

Видимый результат: Browser shows both presentations and landing pages; terminal shows factual scores.

Вход для демо: One conflicting launch brief, survey CSV and source pack.

Выход демо: Analysis, budget, seven-slide presentation, responsive site and summary from each model.

Проверка результата: Parser checks ten factual and functional requirements for each provider.

Как собрать

  1. inspect input
  2. run both models
  3. materialize files
  4. verify calculations
  5. open slides
  6. test site
  7. score limits
  8. input
  9. provider run
  10. materialization

Чеклист перед пилотом

  • both packages exist
  • survey math
  • budget conflict
  • no invented price
  • seven slides
  • working responsive form
  • both launch packages materialized
  • scoreboard generated
  • browser outputs open

Примеры команд, настроек или правил

benchmark_runner.py
verify.py
prompt.txt
brief.md
survey.csv
source_pack.json
requirements.txt
README.md
env CODEVIBERS_ROOT=/Users/urij/Documents/Развитие .venv/bin/python benchmark_runner.py
.venv/bin/python benchmark_runner.py

Требования и рекомендации

Требования

  • identical prompt
  • preserved raw output
  • desktop and mobile review

Рекомендации

  • зафиксировать одинаковый вход
  • проверить расчёты автоматически
  • открыть каждый пользовательский файл

Суть темы

Kimi K3 и ChatGPT получают один и тот же рабочий бриф, CSV и набор проверенных фактов. Обе модели должны собрать анализ, бюджет, презентацию, лендинг и JSON-отчёт. Мы сохраняем сырые ответы, автоматически проверяем девять требований, открываем результат в браузере на компьютере и телефоне, воспроизводим сбой и исправляем мобильную вёрстку.

Что важно забрать

  • Repeat the benchmark with the downloadable fixture pack.
  • Одинаковая реальная задача, проверяемые файлы и честный победитель без пересказа пресс-релиза.
  • Kimi K3 and ChatGPT create files that are parsed, opened and tested rather than subjectively reviewed.
  • Replace subjective AI reviews with identical inputs, deterministic checks and physical browser review.

Как применять на практике

Используйте материал как отправную точку: сформулируйте задачу, ограничьте область применения, выберите метрику качества и проверьте результат на небольшом сценарии до внедрения в production.

Практические шаги

  1. inspect input
  2. run both models
  3. materialize files
  4. verify calculations
  5. open slides
  6. test site
  7. score limits
  8. input

Рекомендации

  • зафиксировать одинаковый вход
  • проверить расчёты автоматически
  • открыть каждый пользовательский файл

Требования и ограничения

  • identical prompt
  • preserved raw output
  • desktop and mobile review

Примеры

  • budget conflict detection
  • responsive landing form

Антипримеры

  • declaring a winner from a pretty first screenshot

Как проверить готовность

  • nine deterministic assertions
  • successful form state on desktop and mobile

Навигация по выпуску

  • 00:00 Результат до объяснений
  • 00:18 Что проверяем
  • 01:21 Официальные возможности Kimi
  • 02:39 Одинаковый вход для двух моделей
  • 05:12 Реальные запуски и пять файлов
  • 10:04 Сбой, конфликт бюджета и скрытые ошибки
  • 12:04 Как устроен воспроизводимый benchmark
  • 15:23 Сломанная мобильная версия и repair
  • 18:41 Девять автоматических проверок
  • 20:28 Результаты в браузере
  • 23:49 Кому подходит Kimi, а кому ChatGPT
  • 24:20 Как повторить тест