ttda704 at SemEval-2026 Task 6: Structured Chain-of-Thought Prompting for Political Evasion Detection - 专知论文

会员服务 ·

0

结构 · 结构化 · 思维链 · semeval · 系统 ·

ttda704 at SemEval-2026 Task 6: Structured Chain-of-Thought Prompting for Political Evasion Detection

翻译：ttda704在SemEval-2026任务6中：面向政治规避检测的结构化思维链提示

Tai Tran Tan,An Dinh Thien

This paper describes our system for SemEval-2026 Task 6, which addresses the classification of political evasion strategies in English question-answer pairs extracted from U.S. presidential interviews. We systematically compare two distinct paradigms: (1) Parameter-Efficient Fine-Tuning of Qwen3 models (4B-32B) using QLoRA, enhanced with tiered upsampling and weighted cross-entropy loss to address severe class imbalance, and (2) structured Chain-of-Thought (CoT) prompting of reasoning-capable API models, namely DeepSeek-V3.2 and Grok-4-Fast. Our evaluation demonstrates that structured CoT prompting of reasoning-enabled models substantially outperforms our baseline parameter-efficient fine-tuning implementation in absolute Macro F1. Our best system, Grok-4-Fast with extended reasoning and few-shot hierarchical CoT prompting, achieves a Macro F1 of 0.5147 on Subtask 2 (9-class evasion) and 0.7979 on Subtask 1 (3-class clarity), ranking 8th out of 33 teams on Subtask 2 and 13th out of 41 teams on Subtask 1 on the official leaderboard. Furthermore, our ablation studies reveal key insights into effective prompt design for evasion detection: presenting labels within a hierarchical taxonomy helps structure model reasoning, while few-shot exemplars provide task calibration. However, the strongest prompt variants are not statistically distinguishable in Macro F1, and explicitly enabling extended reasoning modes yields substantial performance gains by facilitating the multi-step pragmatic analysis required to detect evasive intent.

翻译：本文描述了我们针对SemEval-2026任务6所构建的系统，该任务旨在对从美国总统采访中提取的英文问答对进行政治规避策略分类。我们系统比较了两种不同的范式：（1）基于QLoRA的Qwen3模型（4B-32B）参数高效微调，通过分层上采样和加权交叉熵损失缓解严重的类别不平衡问题；（2）面向具备推理能力的API模型（即DeepSeek-V3.2和Grok-4-Fast）的结构化思维链提示。评估结果表明，在绝对宏F1值上，基于推理模型的结构化思维链提示显著优于我们的基线参数高效微调方案。我们的最佳系统（Grok-4-Fast结合扩展推理与少样本分层思维链提示）在子任务2（9类规避）上达到0.5147的宏F1，在子任务1（3类清晰度）上达到0.7979，在官方排行榜上分别位列第8（共33支队伍）和第13（共41支队伍）。此外，消融实验揭示了规避检测中有效提示设计的关键启示：在分层分类体系中呈现标签有助于构建模型推理结构，而少样本示例则提供任务校准。然而，最优提示变体在宏F1上并无统计显著差异；显式启用扩展推理模式通过促进检测规避意图所需的多步语用分析，可带来显著的性能提升。

0

相关内容

《美国防部基于模型的系统工程（MBSE）转型路径探索：基于能力评估（CBA）的用例研究》120页

《美国防部基于模型的系统工程（MBSE）转型路径探索：基于能力评估（CBA）的用例研究》120页

专知会员服务

47+阅读 · 2025年3月17日

[ICML2024] Spotlight|DAT：通过交互式注意力实现统一的多粒度文本检测

[ICML2024] Spotlight|DAT：通过交互式注意力实现统一的多粒度文本检测

专知会员服务

19+阅读 · 2024年6月26日

AAAI 2024 | Structure-CLIP: 使用场景图知识增强多模态结构化表示

AAAI 2024 | Structure-CLIP: 使用场景图知识增强多模态结构化表示

专知会员服务

38+阅读 · 2024年1月11日

DARPA "少标签学习 "项目《利用任务和领域结构从小型标签集学习》2023最新报告

DARPA "少标签学习 "项目《利用任务和领域结构从小型标签集学习》2023最新报告

专知会员服务

57+阅读 · 2023年12月6日

DARPA项目总结报告《少标签学习》2023最新51页技术报告，美国空军研究实验室

DARPA项目总结报告《少标签学习》2023最新51页技术报告，美国空军研究实验室

专知会员服务

63+阅读 · 2023年5月10日

DARPA“对不同方案的主动解释”（AIDA）计划《Opera：面向运行的概率提取、推理和分析》美国空军2023最新70页技术报告

DARPA“对不同方案的主动解释”（AIDA）计划《Opera：面向运行的概率提取、推理和分析》美国空军2023最新70页技术报告

专知会员服务

58+阅读 · 2023年4月21日

《提高认知雷达和电子战系统的能力》2022最新16页技术白皮书，罗德史瓦兹公司（R&S）

《提高认知雷达和电子战系统的能力》2022最新16页技术白皮书，罗德史瓦兹公司（R&S）

专知会员服务

67+阅读 · 2022年11月16日

清华49页长文全方位分析参数高效微调方案Delta Tuning，揭秘大模型背后的机理

清华49页长文全方位分析参数高效微调方案Delta Tuning，揭秘大模型背后的机理

专知会员服务

50+阅读 · 2022年4月8日

【中科院自动化所】序列到序列语音识别的无监督预训练（Unsupervised pre-training for sequence to sequence speech recognition）

【中科院自动化所】序列到序列语音识别的无监督预训练（Unsupervised pre-training for sequence to sequence speech recognition）

专知会员服务

33+阅读 · 2020年1月5日

Risk Sensitive Portfolio Optimization with Regime-Switching and Default Contagion，香港理工大学应用数学系余翔助理教授，第八届全国社会媒体处理大会SMP2019

Risk Sensitive Portfolio Optimization with Regime-Switching and Default Contagion，香港理工大学应用数学系余翔助理教授，第八届全国社会媒体处理大会SMP2019

专知会员服务

10+阅读 · 2019年10月24日

推荐！《不确定性下的作战决策：推理、序贯和对抗性方法》美国空军293页博士论文，含代码

推荐！《不确定性下的作战决策：推理、序贯和对抗性方法》美国空军293页博士论文，含代码

专知

52+阅读 · 2022年11月16日

【泡泡图灵智库】DenseFusion:基于迭代密集融合的6D目标姿态估计

【泡泡图灵智库】DenseFusion:基于迭代密集融合的6D目标姿态估计

泡泡机器人SLAM

16+阅读 · 2019年9月3日

【泡泡图灵智库】Detect-SLAM：目标检测和SLAM相互收益

【泡泡图灵智库】Detect-SLAM：目标检测和SLAM相互收益

泡泡机器人SLAM

14+阅读 · 2019年6月28日

Seq2seq强化，Pointer Network简介

Seq2seq强化，Pointer Network简介

机器学习算法与Python学习

15+阅读 · 2018年12月8日

从Seq2seq到Attention模型到Self Attention（二）

从Seq2seq到Attention模型到Self Attention（二）

量化投资与机器学习

23+阅读 · 2018年10月9日

用 LDA 和 LSA 两种方法来降维和做 Topic 建模

用 LDA 和 LSA 两种方法来降维和做 Topic 建模

AI研习社

13+阅读 · 2018年8月24日

【论文推荐】最新六篇主题模型相关论文—领域特定知识库、神经变分推断、动态和静态主题模型

【论文推荐】最新六篇主题模型相关论文—领域特定知识库、神经变分推断、动态和静态主题模型

专知

19+阅读 · 2018年6月26日

半监督多任务学习：Semisupervised Multitask Learning

半监督多任务学习：Semisupervised Multitask Learning

我爱读PAMI

18+阅读 · 2018年4月29日

Focal Loss for Dense Object Detection

Focal Loss for Dense Object Detection

统计学习与视觉计算组

12+阅读 · 2018年3月15日

原创 | Attention Modeling for Targeted Sentiment

原创 | Attention Modeling for Targeted Sentiment

黑龙江大学自然语言处理实验室

25+阅读 · 2017年11月5日

基于非参数贝叶斯推断的RNA甲基化谱分解及关键致病酶基因的预测

国家自然科学基金

0+阅读 · 2015年12月31日

基于参数和结构优化的置信规则库推理方法研究

国家自然科学基金

5+阅读 · 2015年12月31日

基于有限元方法的反应扩散种群模型斑图数值模拟研究

国家自然科学基金

0+阅读 · 2015年12月31日

稀疏表达下社会化正则方法与低秩分解推荐模型的研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于深度神经网络的雷达目标高分辨距离像稳健识别方法

国家自然科学基金

6+阅读 · 2015年12月31日

基于Phase-type分布的多状态系统可靠性模型研究

国家自然科学基金

0+阅读 · 2015年12月31日

扩展工作条件下基于核免疫集成的SAR目标识别关键技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于扩展状态观测器的不确定分数阶系统镇定设计

国家自然科学基金

0+阅读 · 2015年12月31日

基于网络解析的低压切负荷在线决策方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

供应商入侵下考虑成员风险规避行为的供应链决策与协调研究

国家自然科学基金

0+阅读 · 2014年12月31日

ttda704 at SemEval-2026 Task 4: Modeling Narrative Structures via Pseudonymization and Multi-View Sentence Alignment

Arxiv

0+阅读 · 6月14日

StanceNakba Shared Task: Actor and Topic-Aware Stance Detection in Public Discourse

Arxiv

0+阅读 · 6月10日

When Built-in Thinking Helps and Hurts: Constraint-Level Error Shifts in Instruction Following

Arxiv

0+阅读 · 6月8日

Block-A-Mole: The Sustainability Frontier of Moving-Target Censorship Resistance

Arxiv

0+阅读 · 6月8日

AlignAtt4LLM: Fast AlignAtt for Decoder-Only LLMs at IWSLT 2026 Simultaneous Speech Translation Task

Arxiv

0+阅读 · 6月2日

True Self-Avoiding Walk for Accelerating Markov-Chain Monte Carlo Integration

Arxiv

0+阅读 · 5月28日

SafeReview: Defending LLM-based Review Systems Against Adversarial Hidden Prompts

Arxiv

0+阅读 · 5月28日

Symbolic Reasoning Frameworks Modulate LLM Risk Aversion in Multi-Agent Strategic Settings

Arxiv

0+阅读 · 5月22日

Text-Dependent Speaker Verification (TdSV) Challenge 2024: Team Naive System Report

Arxiv

0+阅读 · 5月14日

PSK at SemEval-2026 Task 9: Multilingual Polarization Detection Using Ensemble Gemma Models with Synthetic Data Augmentation

Arxiv

0+阅读 · 5月6日

VIP会员

文章信息

相关主题

最新内容

综述 | 世界动作模型：少做梦，多行动

综述 | 世界动作模型：少做梦，多行动

专知会员服务

0+阅读 · 4分钟前

美以伊冲突：无人机与人工智能的运用

美以伊冲突：无人机与人工智能的运用

专知会员服务

1+阅读 · 16分钟前

《战时图神经网络：整合以色列-伊朗冲突中的网络安全与无人机智能》最新50页文献

《战时图神经网络：整合以色列-伊朗冲突中的网络安全与无人机智能》最新50页文献

专知会员服务

1+阅读 · 27分钟前

《特种部队在透明战场中的生存力》最新报告

《特种部队在透明战场中的生存力》最新报告

专知会员服务

1+阅读 · 36分钟前

《自主无人机蜂群协同与控制系统：人工智能赋能的战场协同与自主任务编排平台》

《自主无人机蜂群协同与控制系统：人工智能赋能的战场协同与自主任务编排平台》

专知会员服务

1+阅读 · 40分钟前

《人工智能生成的零日漏洞：对未来作战的影响》

《人工智能生成的零日漏洞：对未来作战的影响》

专知会员服务

1+阅读 · 44分钟前

《理解伙伴国在防务能力选择中的偏好：探索美国解决方案的替代选择》美智库200页报告

《理解伙伴国在防务能力选择中的偏好：探索美国解决方案的替代选择》美智库200页报告

专知会员服务

1+阅读 · 48分钟前

ICML 2026 | 边界嵌入塑形：用自适应对比学习破解图结构纠缠

ICML 2026 | 边界嵌入塑形：用自适应对比学习破解图结构纠缠

专知会员服务

5+阅读 · 6月22日

综述 | 3D场景图：开放挑战与未来方向

综述 | 3D场景图：开放挑战与未来方向

专知会员服务

8+阅读 · 6月22日

《国防工业6.0：全自主作战系统、量子-人工智能融合与新一代战略威慑》

《国防工业6.0：全自主作战系统、量子-人工智能融合与新一代战略威慑》

专知会员服务

6+阅读 · 6月22日

21世纪的无人机战争

21世纪的无人机战争

专知会员服务

4+阅读 · 6月22日

《伊朗与以色列-美国热战及其对数字技术的影响》

《伊朗与以色列-美国热战及其对数字技术的影响》

专知会员服务

5+阅读 · 6月22日

《量子技术的军事任务技术适配与利用》

《量子技术的军事任务技术适配与利用》

专知会员服务

5+阅读 · 6月22日

《美国陆军军官学校（西点军校）本科生科研中生成式人工智能的使用》

《美国陆军军官学校（西点军校）本科生科研中生成式人工智能的使用》

专知会员服务

8+阅读 · 6月22日

美国从乌克兰无人机战争中学习经验

美国从乌克兰无人机战争中学习经验

专知会员服务

7+阅读 · 6月21日

相关VIP内容

《美国防部基于模型的系统工程（MBSE）转型路径探索：基于能力评估（CBA）的用例研究》120页

《美国防部基于模型的系统工程（MBSE）转型路径探索：基于能力评估（CBA）的用例研究》120页

专知会员服务

47+阅读 · 2025年3月17日

[ICML2024] Spotlight|DAT：通过交互式注意力实现统一的多粒度文本检测

[ICML2024] Spotlight|DAT：通过交互式注意力实现统一的多粒度文本检测

专知会员服务

19+阅读 · 2024年6月26日

AAAI 2024 | Structure-CLIP: 使用场景图知识增强多模态结构化表示

AAAI 2024 | Structure-CLIP: 使用场景图知识增强多模态结构化表示

专知会员服务

38+阅读 · 2024年1月11日

DARPA "少标签学习 "项目《利用任务和领域结构从小型标签集学习》2023最新报告

DARPA "少标签学习 "项目《利用任务和领域结构从小型标签集学习》2023最新报告

专知会员服务

57+阅读 · 2023年12月6日

DARPA项目总结报告《少标签学习》2023最新51页技术报告，美国空军研究实验室

DARPA项目总结报告《少标签学习》2023最新51页技术报告，美国空军研究实验室

专知会员服务

63+阅读 · 2023年5月10日

DARPA“对不同方案的主动解释”（AIDA）计划《Opera：面向运行的概率提取、推理和分析》美国空军2023最新70页技术报告

DARPA“对不同方案的主动解释”（AIDA）计划《Opera：面向运行的概率提取、推理和分析》美国空军2023最新70页技术报告

专知会员服务

58+阅读 · 2023年4月21日

《提高认知雷达和电子战系统的能力》2022最新16页技术白皮书，罗德史瓦兹公司（R&S）

《提高认知雷达和电子战系统的能力》2022最新16页技术白皮书，罗德史瓦兹公司（R&S）

专知会员服务

67+阅读 · 2022年11月16日

清华49页长文全方位分析参数高效微调方案Delta Tuning，揭秘大模型背后的机理

清华49页长文全方位分析参数高效微调方案Delta Tuning，揭秘大模型背后的机理

专知会员服务

50+阅读 · 2022年4月8日

【中科院自动化所】序列到序列语音识别的无监督预训练（Unsupervised pre-training for sequence to sequence speech recognition）

【中科院自动化所】序列到序列语音识别的无监督预训练（Unsupervised pre-training for sequence to sequence speech recognition）

专知会员服务

33+阅读 · 2020年1月5日

Risk Sensitive Portfolio Optimization with Regime-Switching and Default Contagion，香港理工大学应用数学系余翔助理教授，第八届全国社会媒体处理大会SMP2019

Risk Sensitive Portfolio Optimization with Regime-Switching and Default Contagion，香港理工大学应用数学系余翔助理教授，第八届全国社会媒体处理大会SMP2019

专知会员服务

10+阅读 · 2019年10月24日

热门VIP内容

开通专知VIP会员享更多权益服务

《战时图神经网络：整合以色列-伊朗冲突中的网络安全与无人机智能》最新50页文献

《自主无人机蜂群协同与控制系统：人工智能赋能的战场协同与自主任务编排平台》

美以伊冲突：无人机与人工智能的运用

《特种部队在透明战场中的生存力》最新报告

相关资讯

推荐！《不确定性下的作战决策：推理、序贯和对抗性方法》美国空军293页博士论文，含代码

推荐！《不确定性下的作战决策：推理、序贯和对抗性方法》美国空军293页博士论文，含代码

专知

52+阅读 · 2022年11月16日

【泡泡图灵智库】DenseFusion:基于迭代密集融合的6D目标姿态估计

【泡泡图灵智库】DenseFusion:基于迭代密集融合的6D目标姿态估计

泡泡机器人SLAM

16+阅读 · 2019年9月3日

【泡泡图灵智库】Detect-SLAM：目标检测和SLAM相互收益

【泡泡图灵智库】Detect-SLAM：目标检测和SLAM相互收益

泡泡机器人SLAM

14+阅读 · 2019年6月28日

Seq2seq强化，Pointer Network简介

Seq2seq强化，Pointer Network简介

机器学习算法与Python学习

15+阅读 · 2018年12月8日

从Seq2seq到Attention模型到Self Attention（二）

从Seq2seq到Attention模型到Self Attention（二）

量化投资与机器学习

23+阅读 · 2018年10月9日

用 LDA 和 LSA 两种方法来降维和做 Topic 建模

用 LDA 和 LSA 两种方法来降维和做 Topic 建模

AI研习社

13+阅读 · 2018年8月24日

【论文推荐】最新六篇主题模型相关论文—领域特定知识库、神经变分推断、动态和静态主题模型

【论文推荐】最新六篇主题模型相关论文—领域特定知识库、神经变分推断、动态和静态主题模型

专知

19+阅读 · 2018年6月26日

半监督多任务学习：Semisupervised Multitask Learning

半监督多任务学习：Semisupervised Multitask Learning

我爱读PAMI

18+阅读 · 2018年4月29日

Focal Loss for Dense Object Detection

Focal Loss for Dense Object Detection

统计学习与视觉计算组

12+阅读 · 2018年3月15日

原创 | Attention Modeling for Targeted Sentiment

原创 | Attention Modeling for Targeted Sentiment

黑龙江大学自然语言处理实验室

25+阅读 · 2017年11月5日

相关论文

ttda704 at SemEval-2026 Task 4: Modeling Narrative Structures via Pseudonymization and Multi-View Sentence Alignment

Arxiv

0+阅读 · 6月14日

StanceNakba Shared Task: Actor and Topic-Aware Stance Detection in Public Discourse

Arxiv

0+阅读 · 6月10日

When Built-in Thinking Helps and Hurts: Constraint-Level Error Shifts in Instruction Following

Arxiv

0+阅读 · 6月8日

Block-A-Mole: The Sustainability Frontier of Moving-Target Censorship Resistance

Arxiv

0+阅读 · 6月8日

AlignAtt4LLM: Fast AlignAtt for Decoder-Only LLMs at IWSLT 2026 Simultaneous Speech Translation Task

Arxiv

0+阅读 · 6月2日

True Self-Avoiding Walk for Accelerating Markov-Chain Monte Carlo Integration

Arxiv

0+阅读 · 5月28日

SafeReview: Defending LLM-based Review Systems Against Adversarial Hidden Prompts

Arxiv

0+阅读 · 5月28日

Symbolic Reasoning Frameworks Modulate LLM Risk Aversion in Multi-Agent Strategic Settings

Arxiv

0+阅读 · 5月22日

Text-Dependent Speaker Verification (TdSV) Challenge 2024: Team Naive System Report

Arxiv

0+阅读 · 5月14日

PSK at SemEval-2026 Task 9: Multilingual Polarization Detection Using Ensemble Gemma Models with Synthetic Data Augmentation

Arxiv

0+阅读 · 5月6日

相关基金

基于非参数贝叶斯推断的RNA甲基化谱分解及关键致病酶基因的预测

国家自然科学基金

0+阅读 · 2015年12月31日

基于参数和结构优化的置信规则库推理方法研究

国家自然科学基金

5+阅读 · 2015年12月31日

基于有限元方法的反应扩散种群模型斑图数值模拟研究

国家自然科学基金

0+阅读 · 2015年12月31日

稀疏表达下社会化正则方法与低秩分解推荐模型的研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于深度神经网络的雷达目标高分辨距离像稳健识别方法

国家自然科学基金

6+阅读 · 2015年12月31日

基于Phase-type分布的多状态系统可靠性模型研究

国家自然科学基金

0+阅读 · 2015年12月31日

扩展工作条件下基于核免疫集成的SAR目标识别关键技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于扩展状态观测器的不确定分数阶系统镇定设计

国家自然科学基金

0+阅读 · 2015年12月31日

基于网络解析的低压切负荷在线决策方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

供应商入侵下考虑成员风险规避行为的供应链决策与协调研究

国家自然科学基金

0+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员