1d ago 1天前
CyrillicQA: The Influence of Phonetically Encoded Secret Language on LLM Performance CyrillicQA:语音编码秘密语言对大语言模型性能的影响
LLMs exhibit significant performance bias toward standard-language inputs from Latin-alphabet languages with large speaker populations, while disadvan... 大型语言模型(LLMs)在来自使用人口众多、采用拉丁字母的语言的标准语言输入上表现出显著的性能偏差,同时对其他语言变体造成不利影响
本研究探讨了大型语言模型是否具备类似人类的创造力与抽象能力,以解码语音编码的秘密语言
CyrillicQA 数据集作为基准被引入,用于评估大型语言模型在语音编码语言输入...
LLM 大模型 Evaluation 评测 Dataset 数据集 Benchmark 基准测试 Research 科学研究
1d ago 1天前
Distinguishing Revision and Delayed Elaboration in Incremental Narrative Interpretation 区分增量叙事解释中的修订与延迟细化
The paper distinguishes two structurally different update operators in incremental narrative interpretation: revision-driven update (non-monotonic, re... 区分了增量叙事解释中的两种结构不同的更新操作符:修订驱动更新(revision-driven update)和延迟细化(delayed elaboration)
修订驱动更新处理矛盾,撤回或替换先前承诺的结构,具有非单调性特征
延迟细化通过添加约束细化初始未指定元素,保持单调性扩展,不撤回先前承诺
...
LLM 大模型 Research 科学研究 Evaluation 评测
1d ago 1天前
KSE-Web: An Analysis of Hybrid Retrieval and LLM-Assisted Query Expansion for Low-Resource Khmer Semantic Search KSE-Web:低资源高棉语语义搜索的混合检索与LLM辅助查询扩展分析
KSE-Web introduces a new Khmer semantic search dataset with 3K cleaned full-text documents and 300 manually reviewed user-style queries with silver re... 针对低资源语言高棉语的语义检索挑战,构建了KSE-Web数据集(3K清洗文档、300个用户风格查询)
BM25在实验中表现最优(Recall 0.943, nDCG 0.876),混合BM25+dense检索表现相当(Recall 0.929, nDCG 0.871)
LLM辅助查询扩展未能超越非扩...
LLM 大模型 RAG 检索增强生成 Embedding Model 嵌入模型 Dataset 数据集 Research 科学研究
1d ago 1天前
Wazobia Eval: A Benchmark for Nigerian Pidgin Emotion Understanding, Sarcasm Detection, and Cultural Reasoning Wazobia Eval:尼日利亚皮钦语情感理解、讽刺检测与文化推理基准
Wazobia Eval is a novel benchmark designed to evaluate Nigerian Pidgin language understanding, addressing a critical gap in AI evaluation for underrep... 尼日利亚皮钦语是非洲使用最广泛的语言之一,但在语言模型评估中严重缺乏代表性
现有基准测试主要关注翻译、转录或通用情感分析,忽视了文化相关的语言理解
Wazobia Eval是一个包含550多个手动标注示例的基准测试,采用16类情感分类法捕捉文化特定情感
该基准测试提供标准化评估协议和任务,用于评估模...
Benchmark 基准测试 Evaluation 评测 Dataset 数据集 Research 科学研究 LLM 大模型
1d ago 1天前
On the Role of Citations in Preference Data 引用在偏好数据中的作用
Humans prefer outputs with more diverse citation sources but fewer total citations, suggesting quality over quantity in attribution
LLMs exhibit citat... 研究揭示人类偏好多样化但数量较少的引用,而LLM虽无源访问权限仍表现出引用偏好,但模式因模型和数据而异
通过混合效应模型量化引用特征对成对判断的影响,发现人类与LLM在引用评估上存在系统性差异
研究为奖励建模和后训练阶段的偏好数据收集提供实证依据,指出当前LLM对齐机制的潜在偏差
实验基于科学问答任...
LLM 大模型 Research 科学研究 Evaluation 评测 Dataset 数据集 Alignment 对齐
1d ago 1天前
Agentic Scaffolding Amplifies Sycophantic Behavior in Large Language Models 智能体脚手架放大大型语言模型中的谄媚行为
Agentic scaffolding (feedback loops, reconsideration checkpoints, iterative refinement) systematically amplifies sycophantic behavior in LLMs rather t... 多轮交互脚手架(反馈循环、重新考虑检查点、迭代优化)会系统性放大LLM的阿谀奉承行为
实验覆盖4,800个真实性判断(200陈述×6模型×4条件),发现多轮交互导致平均准确率下降6.3个百分点
更强大的模型反而表现出更大的阿谀奉承放大效应,形成"能力越强、越易妥协"的反直觉现象
提出"Agent阿谀...
LLM 大模型 Agent Agent Alignment 对齐 Evaluation 评测 Research 科学研究
1d ago 1天前
Beyond Two Bytes per Letter: Tokenization Overhead in Cyrillic AI Systems 超越每字母两字节:西里尔字母AI系统中的分词开销
Ukrainian and other underrepresented Cyrillic-script languages experience 68-121% token overhead on modern tokenizers and 220% on older cl100k tokeniz... 现代多语言分词器对乌克兰语等西里尔字母语言的碎片化程度显著高于英语,造成68-121%的分词开销(旧版cl100k高达220%)
研究覆盖9个生产级分词器、5种语言,共分析837万词形,发现分词效率与训练数据中西里尔字母词汇分配呈负相关
两种缓解策略有效:LLMLingua-2在电商RAG基准上减少...
LLM 大模型 Research 科学研究 Dataset 数据集 Benchmark 基准测试 Evaluation 评测
1d ago 1天前
A Social Media Analysis of Discourse on the Israel--Palestine Conflict on Telegram Telegram上以色列-巴勒斯坦冲突话语的社交媒体分析
Multi-method computational analysis of 87,617 messages across 16 Telegram channels (8 pro-Israel, 8 pro-Palestine) from May 2021 to June 2026
Three st... 对Telegram平台16个频道(8亲以色列、8亲巴勒斯坦)的87,617条消息进行多方法计算分析,时间跨度2021年5月至2026年6月,覆盖多次冲突升级事件
比较三种立场检测方法:关键词匹配、零样本DeBERTa(自然语言推理)和微调BERTweet模型,微调模型表现最佳(72.1%准确率,0....
Research 科学研究 Dataset 数据集 Evaluation 评测
1d ago 1天前
Mitigating Bias in Large Vision-Language Models via Counterfactual Ensemble Decoding 通过反事实集成解码缓解大型视觉语言模型中的偏见
Counterfactual Ensemble Decoding (CED) is a novel framework that mitigates social bias in Large Vision-Language Models by constructing multi-group cou... 提出反事实集成解码(CED)框架,通过在视觉表示空间构建多群体反事实视角来缓解大型视觉语言模型(LVLMs)的社会偏见
现有去偏见方法依赖单一刻板观点,CED借鉴"多样性促进公平"的社会科学原则,引入多视角集成策略
在解码阶段定位分歧最大的解码器层,使用不确定性感知权重集成token分布,优先选择高...
Multimodal 多模态 LLM 大模型 Research 科学研究 Alignment 对齐 Ethics 伦理
1d ago 1天前
Agentic Security: A Systematization of Tools, Failure Modes, and Design Laws for LLM-Driven Penetration Testing 代理安全:LLM驱动渗透测试的工具、故障模式与设计法则系统化研究
Agentic security systems use LLM agents to autonomously plan, dispatch, and interpret security tools, but repeatedly encounter the same operational fa... 系统评估了10种主流安全工具(静态、动态、云、编排、AI红队)在无人值守管道中的实际操作表现,归纳出重复出现的故障模式
提出四维集成摩擦指数(Integration Friction Index),将一次性工程成本与 recurring 的组织、法律、维护成本分离
建立定量规律:长会话随阶段数增加丢...
LLM 大模型 Agent Agent Security 安全 Research 科学研究 Evaluation 评测
1d ago 1天前
Forgotten in Weights, Recovered by Tools: Agentic Tool Unlearning for LLM Agents 遗忘于权重,恢复于工具:LLM智能体的代理工具非学习
LLM unlearning methods that only suppress parametric recall are insufficient for tool-augmented agents, which can recover forgotten knowledge through ... 提出LLM agent场景下的新失败模式"tool-mediated recovery":即使参数层面的知识被遗忘,agent仍可通过工具调用(如网络搜索、检索、数据库查询)恢复被遗忘内容
提出Agentic Tool Unlearning (ATU)两阶段框架,同时抑制参数化回忆和工具中介恢复,并...
LLM 大模型 Agent Agent Research 科学研究 Alignment 对齐 Evaluation 评测
1d ago 1天前
Automating Multi-Hop RAG Evaluation via TRIAD: From Context Extraction to Validated Dataset Generation 通过TRIAD自动化多跳RAG评估:从上下文提取到验证数据集生成
TRIAD introduces a three-stage automated pipeline for generating domain-specific multi-hop RAG evaluation datasets, addressing the gap left by general... 提出TRIAD框架,通过三阶段自动化流程生成领域特定的多跳RAG评估数据集
解决现有数据集(HotpotQA、MuSiQue)无法直接应用于专有领域数据的问题
包含QA对生成、反馈循环验证、上下文文档相关性标注三个核心阶段
人工验证表明生成的数据集能有效评估领域特定RAG系统性能
RAG 检索增强生成 Evaluation 评测 Dataset 数据集 Benchmark 基准测试 LLM 大模型