Коротко
- Anthropic випустила Claude Haiku 5.5 за $0.10 за мільйон вхідних токенів і $0.50 за мільйон вихідних токенів для запитів до 100 000 токенів, порівняно з $1 і $5 для Haiku 4.5.
- Haiku 5.5 набрала 72.4% на офлайн-підмножині OSWorld 2.1 і 39.2% на Terminal-Bench 4.0, випередивши GPT-6 Luna від OpenAI за обома показниками, але значно відстаючи від 70.6% Sonnet 5.5 на тесті з програмування.
- Anthropic також вдвічі знизила ціну читання кешу Sonnet 5.5 до $0.10 за мільйон токенів і цього тижня додає щомісячні API-кредити для підписників Max і Team.
Anthropic випустила Claude Haiku 5.5 у середу, назвавши її найдешевшою, найшвидшою та найздібнішою малою моделлю, яку вона створила. Вона орієнтована на високооб'ємні рутинні завдання, як-от узагальнення документів і запити до баз даних, а також на чутливі до швидкості роботи, як-от жива підтримка клієнтів і керування веббраузером для користувача.
Розробники, які вбудовують Claude у власні продукти, платять $0.10 за мільйон вхідних токенів і $0.50 за мільйон вихідних токенів для запитів до 100 000 токенів. Токени — це невеликі фрагменти тексту, приблизно три чверті слова, які читають і записують ШІ-моделі, і саме за ними виставляють рахунки великі ШІ-компанії. Це відповідає тарифу, який OpenAI встановила для GPT-6 Luna, своєї конкуруючої малої моделі, коли вона запустилася 22 вересня.

Haiku 4.5 стягував $1 і $5, тож нова ставка на 90% нижча, тоді як запити понад 100 000 токенів отримують знижку 50%. Оскільки близько 90% запитів до старої моделі були нижче цієї межі, а Haiku 5.5 розбиває текст на трохи більше токенів, Anthropic оцінює середню економію близько 75%.
Чати з підтримки клієнтів і підсумовування довгих електронних листів — це завдання, для яких Anthropic створив Haiku. Тож по суті повторювані, легкі, не творчі завдання найкраще підходять для цієї моделі.

Втім, бенчмарки показують, що це аж ніяк не дурна модель. Наприклад, на OSWorld 2.1, тесті на те, чи може ШІ керувати справжнім комп’ютером через довгі, багатокрокові завдання, що оцінюється як відсоток часткового зарахування, Haiku 5.5 перемагає GPT Luna від OpenAI, набираючи 72,4% успішності проти 48,9%.
Terminal-Bench 4.0 дає ШІ-агентам професійні завдання, які потрібно виконати, самостійно вводячи команди, і оцінює частку правильно виконаних з першої спроби. Haiku 5.5 досяг 39,2% проти 16,4% у Luna від OpenAI та 0% у Haiku 4.5
Для порівняння, Claude Sonnet 5.5 від Anthropic набрав 70,6%.
Ми спробували модель на простому логічному питанні, і вона відповіла надзвичайно швидко, майже миттєво. Вона також дала неправильну відповідь, а це не те, чого ви хочете від моделі, тож будьте обережні, сліпо довіряючи їй.

На GDPval-AA v2.1, який оцінює моделі за реальною професійною роботою у 44 професіях за шкалою Elo — системою рейтингу за очними поєдинками, запозиченою з шахів, — Haiku 5.5 набрав 1620 балів. Luna отримала 1437, а Haiku 4.5 — 735.
Це також перша модель Haiku з регульованим параметром зусиль — налаштуванням, яке дозволяє користувачам обмінювати вартість на розумніші відповіді. Anthropic також удвічі знизила ціну за читання кешу Sonnet 5.5 до $0,10 за мільйон токенів — зниженої ставки для тексту, який модель уже обробила.
BitcoinBTC · USD
$83,432−0.29%
30 вер.2 жовт.4 жовт.6 жовт.7 жовт.
$86.8k$85.5k$84.3k$83.0k
24h HighHigh$85,643
24h LowLow$82,823
VolVol$1.7B
Ринкові прогнозиКоефіцієнти від Myriad
Сьогодні$82,000 to $84,000$82k–$84k54% chanceЦього тижняBelow $84,000Below $84k60% chance
Купити Bitcoin за USDT
Powered by Jupiter
Haiku 5.5 вийшла через 15 днів після Opus 5.5 22 вересня та через дев'ять днів після Sonnet 5.5 28 вересня — останньої з трьох моделей Claude 5.5, які обіцяла Anthropic. Opus 5.5 став першим випуском після того, як генеральний директор Даріо Амодеї опублікував есе із закликом до галузі сповільнити зростання можливостей ШІ.
Haiku 5.5 вже доступний на вебсайті Claude, Amazon Web Services, Google Cloud і Microsoft Azure під назвою claude-haiku-5-5. Anthropic також цього тижня запроваджує щомісячні кредити API: $100 для передплатників плану Max 5x, $200 для Max 20x і до $500, об'єднаних між користувачами, для планів Team.






