Tren
dar
대시보드
논문
뉴스
GitHub
AI 소식
KO
EN
로그인
AI 소식
논문
대시보드
뉴스
GitHub
“safety”
이 키워드와 관련된 논문 · GitHub · 뉴스를 한곳에 모았습니다.
논문
12
전체 →
OpenAlex
자연어·LLM
인용 1.4K
대규모 언어 모델의 발전과 활용에 대한 종합적 조사
A Survey of Large Language Models
Semantic Scholar
자연어·LLM
인용 288
LLM의 의료 성능과 안전성을 평가하는 오픈소스 벤치마크
HealthBench: Evaluating Large Language Models Towards Improved Human Health
Semantic Scholar
자연어·LLM
인용 183
의료 LLM, 0.001% 데이터 오염만으로도 유해 정보 생성 가능
Medical large language models are vulnerable to data-poisoning attacks
Semantic Scholar
자연어·LLM
인용 143
좁은 작업 파인튜닝이 광범위한 정렬 실패를 유발한다
Training large language models on narrow tasks can lead to broad misalignment
Semantic Scholar
기타
인용 83
생성형 AI가 발견한 특발성 폐섬유증 신약, 2상 임상시험 결과
A generative AI-discovered TNIK inhibitor for idiopathic pulmonary fibrosis: a randomized phase 2a trial
OpenAlex
ML이론·최적화
인용 64
자가 평가 기준이 변할 때 자기 개선의 안정성을 보장하는 이론
Recursive Self-Improvement Stability under Endogenous Yardstick Drift
Semantic Scholar
ML 방법론
인용 8
희소 오토인코더로 LLM 내부를 진단·제어·개선하는 오픈소스 도구
Qwen-Scope: Turning Sparse Features into Development Tools for Large Language Models
Semantic Scholar
자연어·LLM
인용 242
LLM 안전성 평가를 위한 계층적 포괄 벤치마크
SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Semantic Scholar
자연어·LLM
인용 3
LLM의 의료 추론 능력 현황과 한계를 분석한 종합 서베이
Medical Reasoning with Large Language Models: A Survey and MR-Bench
Semantic Scholar
안전·보안
인용 2
LLM 상담에서 역할 인식 기반 멘탈헬스 안전성 평가 프레임워크 제안
MHSafeEval: Role-Aware Interaction-Level Evaluation of Mental Health Safety in Large Language Models
Semantic Scholar
에이전트
인용 122
LLM 에이전트 연구 동향과 전망을 종합적으로 정리한 서베이
Agentic Large Language Models, a survey
Semantic Scholar
자연어·LLM
인용 1
EHR 기반 임상 상담 워크플로우에서 LLM의 역량을 종합 평가하는 프레임워크
AIPatient Arena: EHR-grounded evaluation of large language models in end-to-end clinical consultation workflows
GitHub
1
전체 →
Go
★ 18.8K
alibaba/open-code-review
뉴스
12
전체 →
Hacker News
정책·규제
▲ 211
앤트로픽, 정부의 수출 통제로 Fable 5 접근 차단
Anthropic's Safety Superpower
Hacker News
안전·보안
▲ 8
클로드 페이블 5, 안트로픽 안전장치 우회 성공
Claude Fable 5 jailbroken to bypass Anthropic's new safety guardrails
Hacker News
안전·보안
▲ 4
이기적인 AI 예측기의 진실성에서 안전을 확보하는 LawZero 제안
LawZero: Safety from Honesty in a Disinterested AI Predictor
techcrunch
정책·규제
▲ 0
백악관, 안전 우려로 OpenAI에 새 모델 출시 속도 조절 요구
The White House is asking OpenAI to slow roll the release of its new model over safety concerns
techcrunch
제품·출시
▲ 0
에이전트 실행 비용을 낮춘 클로드 소넷 5 출시
Anthropic launches Claude Sonnet 5 as a cheaper way to run agents
mit_tr
안전·보안
▲ 0
구글 딥마인드, 수백만 AI 에이전트 상호작용 위험 경고
Google DeepMind is worried about what happens when millions of agents start to interact
techcrunch
정책·규제
▲ 0
정부, 안전 우려로 앤트로픽 최강 AI 모델 사용 중단 명령
Anthropic’s safety warnings may have just backfired — the government has pulled the plug on its most powerful AI
Hacker News
안전·보안
▲ 5
앤트로픽 AI 안전장치 우회하는 'Fable' 탈옥 도구 공개
Anthropic's Fable Jailbreak (Circumvent safety nets)
Hacker News
안전·보안
▲ 5
LLM이 코드 취약점을 식별하는 내부 회로를 해부하다
LLMs use "safety" specific neuron layers to identify vulnerabilities in code
techcrunch
안전·보안
▲ 0
xAI, 그록 안전 우려 제기한 엔지니어 해고…소송 제기
xAI fired an engineer who raised alarms about Grok safety, new lawsuit claims
OpenAI
정책·규제
▲ 0
오픈AI, 최첨단 AI 민주적 거버넌스 청사진 제시
A blueprint for democratic governance of frontier AI
OpenAI
안전·보안
▲ 0
배포 전 AI 모델 행동 예측하는 시뮬레이션 기법
Predicting model behavior before release by simulating deployment