전체 글328 Sonnet 5 성능이 왜 이래? Sonnet 4.6보다 돌종벤치 점수 낮음. https://youtu.be/U3aWuED1v2sSonnet 5 성능이 왜 이래? Sonnet 4.6보다 돌종벤치 점수 낮음. Fable 5는 7월2일 새벽부터 다시 열렸습니다. 그리고 Sonnet 5가 출시되었습니다. 그런데 돌종벤치에서 한 문제를 틀렸습니다. 마지막 비전 추론 문제를 틀렸습니다. 가격도 출력 1M토큰당 15달러(8/31까지 10달러)로 그렇게 매력적이지는 않네요. 테스트 결과 시트 공유 https://docs.google.com/spreadsheets/d/1l2LVcFs5DlIiDrkMmHht1004iZRFzClkEp8agy0KiHA/edit?gid=1278489464#gid=1278489464테스트 문제 프롬프트 https://blog.naver.com/dolljong/22396.. 2026. 7. 2. LongCat-2.0 중국 배달앱 회사가 오픈소스로 공개한 1.6T 크기 모델. 중국의 배달앱 회사인 메이투안 (Meituan)에서 1.6T의 모델을 오픈소스로 공개했습니다. 돌종벤치에서는 교대단면도 그리는 코딩문제를 3번째 시도에서 성공했고, 비전추론 문제 2문제를 틀려서 16문제 기준으로 84점을 받았습니다. 관련 링크 https://huggingface.co/meituan-longcat/LongCat-2.0테스트 결과 시트 공유 https://docs.google.com/spreadsheets/d/1l2LVcFs5DlIiDrkMmHht1004iZRFzClkEp8agy0KiHA/edit?gid=1278489464#gid=1278489464테스트 문제 프롬프트 https://blog.naver.com/dolljong/223961139070#AI #인공지능 #LongCat-2.0 .. 2026. 7. 1. 일본 AI서비스. Fugu-Ultra 엔지니어링 업무 능력 테스트. 구글 출신들이 만듦. 일본 AI서비스. Fugu-Ultra 엔지니어링 업무 능력 테스트. 구글 출신들이 만듦. 생성형 AI의 기술적 토대인 'Attention is All you need'라는 논문의 공동저자인 Llion Jones와 역시 구글 출신인 David Ha가 동경에서 공동창업한 Sakana AI에서 만든 서비스입니다. 여러 모델들 중 어느 모델을 쓸 것인가를 학습을 통해서 선택한다는 개념입니다. 가격은 생각보다 비쌉니다. 출력 기준 30달러/1M 아무래도 다른 모델들을 쓰다보니 비쌀 수 밖에 없지 않을까 싶습니다. 테스트 결과 시트 공유 https://docs.google.com/spreadsheets/d/1l2LVcFs5DlIiDrkMmHht1004iZRFzClkEp8agy0KiHA/edit?gid=1278489.. 2026. 6. 30. Seed 2.1 pro 틱톡 만든 회사의 LLM 성능 많이 올라옴. Seed 2.1 pro 틱톡 만든 회사의 LLM 성능 많이 올라옴. 틱톡을 만든 회사의 LLM성능이 많이 올라왔습니다. 엔지니어링 업무 능력을 평가하는 돌종벤치에서 한문제만 틀려서 94점을 받았습니다. 테스트 결과 시트 공유 https://docs.google.com/spreadsheets/d/1l2LVcFs5DlIiDrkMmHht1004iZRFzClkEp8agy0KiHA/edit?gid=1278489464#gid=1278489464테스트 문제 프롬프트 https://blog.naver.com/dolljong/223961139070#Ai #인공지능 #토목구조기술사 #틱톡 #Seed-2.1-pro #토목공학 #토목시공기술사 #도로및공항기술사 #토질및기초기술사 #철도기술사 #도시계획기술사 https://.. 2026. 6. 30. 이전 1 2 3 4 ··· 82 다음