All authors

Claude Skills by hiyenwong
github.com/hiyenwong9,934 skills5 installs19,223 views
- Arxiv 2608 05981v1 Temporal Bridges For Spatial Resolution EnhancingTemporal Bridges for Spatial Resolution: Enhancing Climate Data Super-Resolution with Bidirectional Alignment (arXiv: 2608.05981v1)Votes: 0GitHub stars: 3
- Arxiv 2608 06012 Herald Counterfactual Audits And Minimal Repairs FHERALD: Counterfactual Audits and Minimal Repairs for Proof-of-Retrieval Rewards (arXiv: 2608.06012)Votes: 0GitHub stars: 3
- Arxiv 2608 06012v1 Herald Counterfactual Audits And Minimal Repairs FHERALD: Counterfactual Audits and Minimal Repairs for Proof-of-Retrieval Rewards (arXiv: 2608.06012v1)Votes: 0GitHub stars: 3
- Arxiv 2608 06057 When History Lies Evaluating And Improving Tool UsWhen History Lies: Evaluating and Improving Tool Use under Misleading Multi-Turn Histories (arXiv: 2608.06057)Votes: 0GitHub stars: 3
- Arxiv 2608 06057v1 When History Lies Evaluating And Improving Tool UsWhen History Lies: Evaluating and Improving Tool Use under Misleading Multi-Turn Histories (arXiv: 2608.06057v1)Votes: 0GitHub stars: 3
- Arxiv 2608 06144 Finevo Bench A Longitudinal Benchmark For Self EvoFinEvo-Bench: A Longitudinal Benchmark for Self-Evolving Agents in Professional Financial Workflows (arXiv: 2608.06144)Votes: 0GitHub stars: 3
- Arxiv 2608 06144v1 Finevo Bench A Longitudinal Benchmark For Self Evo**arXiv ID:** 2608.06144v1 **Authors:** Bo Deng, Kang Zhou, Lifan Guo, Chongyang Tao, Xuanren Chen, Chenggang Xie, Renzhao Liang, Feng Chen, Chi Zhang **URL:** http://arxiv.org/abs/2608.06144v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 06167 Schema Guided Hierarchical Information ExtractionSchema-Guided Hierarchical Information Extraction and Semantic Evaluation Using Generative AI (arXiv: 2608.06167)Votes: 0GitHub stars: 3
- Arxiv 2608 06167v1 Schema Guided Hierarchical Information ExtractionSchema-Guided Hierarchical Information Extraction and Semantic Evaluation Using Generative AI (arXiv: 2608.06167v1)Votes: 0GitHub stars: 3
- Arxiv 2608 06179 Saga Score Weighted Adaptive Generation AlignmentSAGA: Score-Weighted Adaptive Generation Alignment for Low-Resource Nordic Language Models (arXiv: 2608.06179)Votes: 0GitHub stars: 3
- Arxiv 2608 06179v1 Saga Score Weighted Adaptive Generation AlignmentSAGA: Score-Weighted Adaptive Generation Alignment for Low-Resource Nordic Language Models (arXiv: 2608.06179v1)Votes: 0GitHub stars: 3
- Arxiv 2608 06202 What Current Ai Benchmarks Leave Unmeasured ModaliWhat Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations) (arXiv: 2608.06202)Votes: 0GitHub stars: 3
- Arxiv 2608 06202v1 What Current Ai Benchmarks Leave Unmeasured Modali**arXiv ID:** 2608.06202v1 **Authors:** Ro Encarnación, Tina Behzad, Emma Lurie, Danaé Metaxa **URL:** http://arxiv.org/abs/2608.06202v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 06221 Robot Learning From Human Demonstrations HandwrittRobot Learning from Human Demonstrations: Handwritten Alphabet Trajectories and Human-Likeness Evaluation (arXiv: 2608.06221)Votes: 0GitHub stars: 3
- Arxiv 2608 06221v1 Robot Learning From Human Demonstrations HandwrittRobot Learning from Human Demonstrations: Handwritten Alphabet Trajectories and Human-Likeness Evaluation (arXiv: 2608.06221v1)Votes: 0GitHub stars: 3
- Arxiv 2608 06265 Improving The Realism Of Synthetic Clinical BenchmImproving the Realism of Synthetic Clinical Benchmarks Under Utility Constraints (arXiv: 2608.06265)Votes: 0GitHub stars: 3
- Arxiv 2608 06265v1 Improving The Realism Of Synthetic Clinical BenchmImproving the Realism of Synthetic Clinical Benchmarks Under Utility Constraints (arXiv: 2608.06265v1)Votes: 0GitHub stars: 3
- Arxiv 2608 06305 Beyond Top K Replacing Black Box Retrieval With InBeyond Top-K: Replacing Black-Box Retrieval with Interpretable Agentic Operations (arXiv: 2608.06305)Votes: 0GitHub stars: 3
- Arxiv 2608 06305v1 Beyond Top K Replacing Black Box Retrieval With In**arXiv ID:** 2608.06305v1 **Authors:** Sagar Tamang, Ayush Vyas, Tabarakul Hazarika **URL:** http://arxiv.org/abs/2608.06305v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 06329 Benchmarking The Benchmarks Evaluating BenchmarksBenchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents (arXiv: 2608.06329)Votes: 0GitHub stars: 3
- Arxiv 2608 06329v1 Benchmarking The Benchmarks Evaluating Benchmarks**arXiv ID:** 2608.06329v1 **Authors:** Noam Koren, Roy Bar-Haim, Abigail Goldsteen **URL:** http://arxiv.org/abs/2608.06329v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 06351 Challenges In Evaluating Explanation Methods For SChallenges in Evaluating Explanation Methods for Static and Evolving Data (arXiv: 2608.06351)Votes: 0GitHub stars: 3
- Arxiv 2608 06351v1 Challenges In Evaluating Explanation Methods For SChallenges in Evaluating Explanation Methods for Static and Evolving Data (arXiv: 2608.06351v1)Votes: 0GitHub stars: 3
- Arxiv 2608 12717v1 Perturbation Based Regional Interpretability Throu**arXiv ID:** 2608.12717v1 **Authors:** Xiang Guan, Roger D. Newman-Norlund, Yong Yang, Saeed Ahmadi, Regan Willis, Nadra Salman, Kalil Warren, Srihari Nelakuditi, Chris Rorden, Leonardo Bonilha, Julius Fridriksson **URL:** http://arxiv.org/abs/2608.12717v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 12805v1 Comedbench A Multi Source Benchmark Of Synthetic M**arXiv ID:** 2608.12805v1 **Authors:** Akanta Das, Al Amin Farhad, Mrinmoy Sarkar Anto, David Rehkopf, Ayin Vala, Tanmoy Sarkar Pias **URL:** http://arxiv.org/abs/2608.12805v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 12987v1 Generative Universal Multimodal Retrieval With Dua**arXiv ID:** 2608.12987v1 **Authors:** Kaipeng Li, Haitao Yu, Xuanchen Zhou **URL:** http://arxiv.org/abs/2608.12987v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 13113v1 Egomonth A Month Level Egocentric Video Benchmark**arXiv ID:** 2608.13113v1 **Authors:** Weitao Chen, Hu Jiaxin, Xie Tianyidan, Yang Li, Yuyi Qian, Banghao Xu, Ziheng Tang, Shenyi Wang, Mingyue Yu, Duo Li, Jiacheng Shi, Gao Wang, Zhan Xu, Zhicheng Qiu, Xuanfu Li, Jian Yang, Lanjun Wang, Zili Yi **URL:** http://arxiv.org/abs/2608.13113v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 13136v1 Ligbench A Unified And Human Aligned Benchmark For**arXiv ID:** 2608.13136v1 **Authors:** Chenrun Wang, Mingxuan Zhu, Tiancheng Huang, Wenjie Li, Yujie Zhang, Zichen Zhu, Zhiying Zou, Kai Yu, Lu Chen **URL:** http://arxiv.org/abs/2608.13136v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 13197 Beyond Simulated Benchmarks Evaluating Motion ReprBeyond Simulated Benchmarks: Evaluating Motion Representations for Fall Detection Under Real-World D (arXiv: 2608.13197)Votes: 0GitHub stars: 3
- Arxiv 2608 13197v1 Beyond Simulated Benchmarks Evaluating Motion Repr**arXiv ID:** 2608.13197v1 **Authors:** Timilehin B. Aderinola, Ilaria D'Ascanio, Luca Palmerini, Lorenzo Chiari, Jochen Klenk, Clemens Becker, Brian Caulfield, Georgiana Ifrim **URL:** http://arxiv.org/abs/2608.13197v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 13210 Naru A Benchmark For Narrative Evolution And CultuNARU: A Benchmark for NARrative Evolution and Cultural Nuance Understanding in Japanese Extreme Long (arXiv: 2608.13210)Votes: 0GitHub stars: 3
- Arxiv 2608 13210v1 Naru A Benchmark For Narrative Evolution And Cultu**arXiv ID:** 2608.13210v1 **Authors:** Yuheng Huang, Jianlang Chen, Jiayang Song, Hua Qi, Aza Kai, Vincent Markert, Edison Marrese-Taylor, Jianjun Zhao, Lei Ma **URL:** http://arxiv.org/abs/2608.13210v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 13267 How Do Vlms Behave When Blind Or Misled BehavioralHow Do VLMs Behave When Blind or Misled? Behavioral Evaluation of VLMs on Scientific Figures (arXiv: 2608.13267)Votes: 0GitHub stars: 3
- Arxiv 2608 13317v1 Statebridge Training Free Hidden State Alignment F**arXiv ID:** 2608.13317v1 **Authors:** Yanwen Peng, Delvin Ce Zhang, Xi Wang, Nikolaos Aletras **URL:** http://arxiv.org/abs/2608.13317v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 13344v1 Longearth R1 Benchmarking And Aligning Vision Lang**arXiv ID:** 2608.13344v1 **Authors:** Yupan Ding, Jing Xiao, Zhenyuan Zhang, Chaofeng Chen, Liang Liao, Gui-Song Xia, Mi Wang **URL:** http://arxiv.org/abs/2608.13344v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 13345v1 Rules Or Character Scaling Laws For Ai Safety Desi**arXiv ID:** 2608.13345v1 **Authors:** Satoshi Takahashi, Nobuji Kouno, Masaaki Komatsu, Ryuji Hamamoto **URL:** http://arxiv.org/abs/2608.13345v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 13482 Synthetic Persona Pretraining Alignment From TokenSynthetic Persona Pretraining: Alignment from Token Zero (arXiv: 2608.13482)Votes: 0GitHub stars: 3
- Arxiv 2608 13482v1 Synthetic Persona Pretraining Alignment From Token**arXiv ID:** 2608.13482v1 **Authors:** Julian Minder, Viktor Moskvoretskii, Raghav Singhal, Difan Jiao, Andy Arditi, Shaobo Cui, Yiderigun Borjigin, Kartik Bali, Stefan Krsteski, Harsh Raj, Huu Nguyen, Jannik Brinkmann, Ashton Anderson, Roland Aydin, Robert West **URL:** http://arxiv.org/abs/2608.13482v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 18524v1 Dart Sd Diamond Topology Aware Retrieval And Tunin**arXiv ID:** 2608.18524v1 **Authors:** Hangrui Xu, Jiarui Wang, Yang Yang, Chuanbo Zhu, Fangda Chen, Ziqi Wu, Jingming Cai, Yan Song **URL:** http://arxiv.org/abs/2608.18524v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 18534v1 Finrca Bench Benchmarking Evidence Retrieval And R**arXiv ID:** 2608.18534v1 **Authors:** Pratik Ghawate **URL:** http://arxiv.org/abs/2608.18534v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 18586v1 Omnihandwritingocr A Diagnostic Benchmark For Eval**arXiv ID:** 2608.18586v1 **Authors:** Zinuo Guo, Min Zhang, Bo Jiang **URL:** http://arxiv.org/abs/2608.18586v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 18675v1 An Empirical Benchmark Of Deep Time Series Models**arXiv ID:** 2608.18675v1 **Authors:** Behnaz Kavoosighafi, Maria Eidenskog, Wiktoria Glad, Katerina Vrotsou **URL:** http://arxiv.org/abs/2608.18675v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 18694v1 Composed Historical Image Retrieval By Modeling Te**arXiv ID:** 2608.18694v1 **Authors:** Adrià Molina Rodríguez, Oriol Ramos Terrades, Josep Lladós Canet **URL:** http://arxiv.org/abs/2608.18694v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 18746v1 Decision Metric Alignment In Latent World Models D**arXiv ID:** 2608.18746v1 **Authors:** Jiawei Wang, Ke Rui, Yushen Zuo, Yichun Feng, Minglei Li **URL:** http://arxiv.org/abs/2608.18746v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 18759v1 Beyond Predictive Fairness Quantifying Attribution**arXiv ID:** 2608.18759v1 **Authors:** Kerol Djoumessi, Philipp Berens **URL:** http://arxiv.org/abs/2608.18759v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 18919v1 Lost In Aggregation How Benchmarks Overlook Irrepl**arXiv ID:** 2608.18919v1 **Authors:** Andrej Tschalzev, Stefan Lüdtke, Heiner Stuckenschmidt, Christian Bartelt **URL:** http://arxiv.org/abs/2608.18919v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 19141v1 Geometric Iterative Retrieval For Neural Audio Cod**arXiv ID:** 2608.19141v1 **Authors:** Leo Schmidt-Traub, Frédéric Berdoz, Luca A. Lanzendörfer, Roger Wattenhofer **URL:** http://arxiv.org/abs/2608.19141v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 19936 Towards Quantifying Benchmark Optimization In AsrTowards Quantifying Benchmark Optimization in ASR Models (arXiv: 2608.19936)Votes: 0GitHub stars: 3
- Arxiv 2608 20024 Systematic Evaluation Of Tabpfn Ts For Zero Shot PSystematic Evaluation of TabPFN-TS for Zero-Shot Probabilistic Heat Load Forecasting in District Heating Networks (arXiv: 2608.20024)Votes: 0GitHub stars: 3
- Arxiv 2608 20025 Clast Context Aware Contrastive Vae For ProbabilisCLaST: Context-aware Contrastive VAE for Probabilistic Time Series Forecasting (arXiv: 2608.20025)Votes: 0GitHub stars: 3