成为VIP会员查看完整内容
VIP会员码认证
首页
主题
会员
服务
注册
·
登录
置换
关注
0
综合
百科
VIP
热门
动态
论文
精华
Privacy Amplification Without Independence: How Far Negative Dependence Carries the Guarantees of Poisson Subsampling
Arxiv
0+阅读 · 9月1日
FlavourBench: Executable Culinary Reward Maps for Language Model Evaluation and Post-Training
Arxiv
0+阅读 · 9月2日
A Certificate-Producing Cascade for Equational Implication: The SAIR EQT2 Stage 2 Solver
Arxiv
0+阅读 · 9月1日
AgentProv: Auditing Agentic LLM API Providers via Tool-use Policy Probes
Arxiv
0+阅读 · 8月30日
Item-Mean Surrogates: Why Richer Persona Data Fail to Improve LLMs as Human Surrogates
Arxiv
0+阅读 · 8月29日
Sleight of Word Benchmark: Can Language Models Notice If Their Own Output Was Tampered With?
Arxiv
0+阅读 · 8月30日
Pearmut: Human Evaluation of Translation Made Trivial
Arxiv
0+阅读 · 8月29日
SDGBiasBench: Benchmarking and Mitigating Vision--Language Models' Biases in Sustainable Development Goals
Arxiv
0+阅读 · 8月28日
When Can Conditional Flow Matching Replace Pointwise Negative Log-Likelihood?
Arxiv
0+阅读 · 8月28日
A Bayesian Longitudinal Model for Imputing Item-Level Missing Data in Trial-Based Economic Evaluations
Arxiv
0+阅读 · 8月27日
CNeo-Bench: Diagnosing Large Language Models on Chinese Neologisms
Arxiv
0+阅读 · 8月28日
Twin Worlds: Equivariance-Based Abstention for Evidence-Grounded Reasoning
Arxiv
0+阅读 · 8月28日
Sycamore: Characterizing Synthetic Personas for Evaluating Genomics Visualization Retrieval
Arxiv
0+阅读 · 7月8日
A Machine-checked Proof of Consistency for Impredicative Pure Type Systems
Arxiv
0+阅读 · 7月22日
Blind to the Pivotal Vote: Aggregate Independence Metrics Miss Where Verification Actually Helps
Arxiv
0+阅读 · 8月7日
参考链接
提示
微信扫码
咨询专知VIP会员与技术项目合作
(加微信请备注: "专知")
微信扫码咨询专知VIP会员
Top