Tren
dar
대시보드
논문
뉴스
GitHub
AI 소식
KO
EN
로그인
AI 소식
논문
대시보드
뉴스
GitHub
“benchmark”
이 키워드와 관련된 논문 · GitHub · 뉴스를 한곳에 모았습니다.
논문
12
전체 →
Semantic Scholar
ML 방법론
인용 65
딥러닝과 물리 시뮬레이션 결합으로 단일/다중 도메인 단백질 구조 예측 정확도 향상
Deep-learning-based single-domain and multidomain protein structure prediction with D-I-TASSER
OpenAlex
자연어·LLM
인용 1.4K
대규모 언어 모델의 발전과 활용에 대한 종합적 조사
A Survey of Large Language Models
Semantic Scholar
자연어·LLM
인용 1.7K
지속적 수집으로 오염 없는 코드 LLM 평가 벤치마크
LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code
Semantic Scholar
멀티모달
인용 568
강화학습으로 멀티모달 대규모 언어모델의 추론 능력 향상
Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
Semantic Scholar
자연어·LLM
인용 554
LLM의 수학적 추론 능력 한계를 밝힌 GSM-Symbolic 벤치마크
GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models
OpenAlex
ML 방법론
인용 344
하우스홀더 반사로 유니터리 행렬을 매개변수화한 순수 RNN으로 장기 시퀀스 모델링
Axiom: A Householder-Parameterized Pure Unitary RNN for Long-Range Sequence Modeling
Semantic Scholar
자연어·LLM
인용 501
디코더 전용 LLM을 텍스트 인코더로 변환하는 비지도 방법
LLM2Vec: Large Language Models Are Secretly Powerful Text Encoders
Semantic Scholar
자연어·LLM
인용 500
LLM 탈옥 공격 평가를 위한 개방형 벤치마크
JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models
Semantic Scholar
멀티모달
인용 489
멀티모달 LLM은 보지만 인지하지는 못한다는 것을 밝힌 벤치마크
BLINK: Multimodal Large Language Models Can See but Not Perceive
Semantic Scholar
자연어·LLM
인용 395
LLM 추론 효율화를 위한 오버싱킹 문제와 해결 방안 종합 분석
Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models
Semantic Scholar
자연어·LLM
인용 318
여러 토큰을 동시에 예측해 LLM 성능과 속도를 개선
Better & Faster Large Language Models via Multi-token Prediction
Semantic Scholar
자연어·LLM
인용 288
LLM의 의료 성능과 안전성을 평가하는 오픈소스 벤치마크
HealthBench: Evaluating Large Language Models Towards Improved Human Health
GitHub
7
전체 →
Python
★ 29.6K
tirth8205/code-review-graph
에이전트
Python
★ 1.8K
벤치마크 성능을 자율적으로 개선하는 자기 개선 AI 프레임워크
hexo-ai/sia
Jupyter Notebook
★ 4.1K
FareedKhan-dev/all-agentic-architectures
Python
★ 1.1K
uber/ADR
에이전트
TypeScript
★ 23.2K
AI 코딩 에이전트에 지속적 메모리를 제공하는 오픈소스 라이브러리
뉴스
12
전체 →
Hacker News
안전·보안
▲ 631
GLM 5.2, 프롬프트만으로 IDOR 탐지에서 Claude를 제치다
GLM 5.2 beats Claude in our benchmarks
Hacker News
에이전트
▲ 5
엔터프라이즈 워크플로우에서 AI 에이전트 성능을 평가하는 FlowerBench 벤치마크 공개
FlowerBench: Benchmarking AI Agents on Real Enterprise Work
Hacker News
제품·출시
rohitg00/agentmemory
AI인프라
Python
★ 5.6K
내 하드웨어에 맞는 최고의 로컬 LLM을 찾아주는 도구
Andyyyy64/whichllm
에이전트
Python
★ 55.5K
로컬 우선 AI 메모리 시스템, 장기 대화 맥락 유지에 특화
MemPalace/mempalace
▲ 5
AA-Benchmarks, GLM-5.2, GPT-5.5 상회하는 새로운 에이전트 지식 작업 평가
GLM-5.2 is above GPT-5.5 in new agentic knowledge work eval
Hacker News
산업·기업
▲ 19
웨이보의 3B 모델이 벤치마크 논란을 불러일으키다
Why Weibo's tiny VibeThinker-3B has the AI world arguing over benchmarks again
Hacker News
제품·출시
▲ 5
AI가 넷플로우 데이터로 보안 작업을 수행하는지 평가하는 오픈 벤치마크 공개
Show HN: SOCBench – an open benchmark for AI on SoC tasks
Hacker News
산업·기업
▲ 5
LLM 벤치마크는 남의 문제를 풀고 있다
LLM benchmarks are answering someone else's question
OpenAI
제품·출시
▲ 0
생명과학 연구 AI 평가를 위한 전문가 검증 벤치마크
Introducing LifeSciBench
OpenAI
제품·출시
▲ 0
유전체·생물학·과학 연구용 AI 성능 평가 벤치마크 GeneBench-Pro 공개
Introducing GeneBench-Pro
Hacker News
안전·보안
▲ 7
LLM 보안 벤치마크 현황과 필요성에 대한 커뮤니티 질문
Ask HN: Are there good security benchmarks for LLMs?
Hacker News
▲ 83
When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation
Hacker News
▲ 59
Homebench – Benchmark local LLMs for speed, memory, and quality
Hacker News
▲ 122
My personal AI benchmark: “Generate an SVG of a frog with a Habsburg jaw”