{"as_of":"2026-08-15T09:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:413cb20cedefac6b08d3469854507e48a6f98786f2e0884febf4a53d1624f08d","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:30:47.578235Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05139/citation-record","integrity":"/paper/2608.05139/integrity","json":"/paper/2608.05139/citation-record.json","paper":"/paper/2608.05139"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.19988","last_updated":"2026-05-25T11:39:46Z","snapshot_observed_at":"2026-08-08T06:13:52.041058Z","submitted_at":"2025-08-27T15:47:19Z","title":"AgentCoMa: A Compositional Benchmark Mixing Commonsense and Mathematical Reasoning in Real-World Scenarios","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19988","snapshot_observed_at":"2026-08-06T04:30:38.138268Z","title":"Rahmani, and Marek Rei","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:38.138268Z"},"links":{"cited_paper":"/paper/2508.19988","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:436e2ff78b2da1ea0979eef6745e277c879f54d0611f4cf86383cf7ebdbf881f","observation_id":"22f954c5-f7fa-4896-b4de-52cadc159226","resolution":{"observed_at":"2026-08-06T04:30:38.138268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18177","last_updated":"2026-04-21T05:00:31Z","snapshot_observed_at":"2026-07-31T18:21:25.678027Z","submitted_at":"2026-04-20T12:33:59Z","title":"STaD: Scaffolded Task Design for Identifying Compositional Skill Gaps in LLMs","version":2},"cited_work":{"arxiv_id":"2604.18177","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.18177","snapshot_observed_at":"2026-08-06T04:30:49.761722Z","title":"STaD: Scaffolded Task Design for Identifying Compositional Skill Gaps in LLMs","venue":"cs.CL","work_id":"a248f0b8-44ef-4293-91d0-64cbd13cbf1a","year":2026},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:38.264262Z"},"links":{"cited_paper":"/paper/2604.18177","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:508a641283ff5b0dabd11c93b1c2b07a03d59e4ceb1c19ee0f63f02b6dff3faa","observation_id":"85344c15-b040-40d8-8ff8-eda6b9ff7f74","resolution":{"observed_at":"2026-08-06T04:30:49.765028Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12782","last_updated":"2026-04-19T12:03:21Z","snapshot_observed_at":"2026-08-09T12:22:20.592760Z","submitted_at":"2025-08-18T09:59:02Z","title":"HeroBench: A Benchmark for Long-Horizon Planning and Structured Reasoning in Virtual Worlds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.12782","snapshot_observed_at":"2026-08-06T04:30:38.368705Z","title":"HeroBench: A benchmark for long-horizon planning and structured reasoning in virtual worlds.arXiv preprint arXiv:2508.12782, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:38.368705Z"},"links":{"cited_paper":"/paper/2508.12782","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:63a5edd4aabc26ed7b432070f600d2c388ec0738382256c500fc000db2749f97","observation_id":"2fc5af15-6fa6-4c42-acba-1ed19670ae6c","resolution":{"observed_at":"2026-08-06T04:30:38.368705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10339","last_updated":"2025-08-14T04:48:38Z","snapshot_observed_at":"2026-08-09T12:07:25.208197Z","submitted_at":"2025-08-14T04:48:38Z","title":"Concepts or Skills? Rethinking Instruction Selection for Multi-modal Models","version":1},"cited_work":{"arxiv_id":"2508.10339","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.10339","snapshot_observed_at":"2026-08-06T04:30:49.738788Z","title":"Concepts or Skills? Rethinking Instruction Selection for Multi-modal Models","venue":"cs.CV","work_id":"de46b9e9-5961-4bc4-8b3c-cbeebbc00064","year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:38.448384Z"},"links":{"cited_paper":"/paper/2508.10339","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:cd624e935597d64cba0bb8a21845921dfd3767475c0b5d728dacceee630ac6fe","observation_id":"d332b2ae-1cc2-4932-99a7-15062ac05017","resolution":{"observed_at":"2026-08-06T04:30:49.742374Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05641","last_updated":"2026-05-30T02:07:53Z","snapshot_observed_at":"2026-08-10T07:39:53.663974Z","submitted_at":"2025-03-07T18:03:13Z","title":"Skill-Based Mixture-of-Experts: Adaptive Routing for Heterogeneous Reasoning via Inferred Skills","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05641","snapshot_observed_at":"2026-08-06T04:30:38.535214Z","title":"Symbolic mixture-of-experts: Adaptive skill-based routing for heterogeneous reasoning.arXiv preprint arXiv:2503.05641, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:38.535214Z"},"links":{"cited_paper":"/paper/2503.05641","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:912de9d33209642af793d0bde881308942db840a8dc5891e2671cb6c6044eefc","observation_id":"314b5d5d-6905-4b0c-94ec-bb31b4f714f4","resolution":{"observed_at":"2026-08-06T04:30:38.535214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:38.636140Z","title":"SkillCraft: Can LLM agents learn to use tools skillfully?arXiv preprint arXiv:2603.00718, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:38.636140Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:c066c5face87b6d0bb5523237f9a9978776304462d7c723254f29d45de3904da","observation_id":"7726b0ef-4a0a-42e4-8438-80c868ed471b","resolution":{"observed_at":"2026-08-06T04:30:38.636140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:38.777948Z","title":"Self-evolving curriculum for LLM reasoning.arXiv preprint arXiv:2505.14970, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:38.777948Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:c3347cdb0b7ac27b09c63090011bcdaec098a2f8252139d6e17ad7784fc0980e","observation_id":"79047070-6705-4482-9ea9-ef5261f62b8a","resolution":{"observed_at":"2026-08-06T04:30:38.777948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.09465","last_updated":"2021-11-08T08:31:44Z","snapshot_observed_at":"2026-08-11T15:00:09.844958Z","submitted_at":"2021-01-23T09:43:44Z","title":"WebSRC: A Dataset for Web-Based Structural Reading Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.09465","snapshot_observed_at":"2026-08-06T04:30:38.889955Z","title":"WebSRC: A dataset for web-based structural reading comprehension.arXiv preprint arXiv:2101.09465, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:38.889955Z"},"links":{"cited_paper":"/paper/2101.09465","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:9fe82919f261e2295b3a7031c06821c60ba7d6cdfe187a920934e8d85eb8a7c7","observation_id":"af86f2c9-eed4-4a18-90d8-f13ccc6943a8","resolution":{"observed_at":"2026-08-06T04:30:38.889955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-13T07:29:10.630046Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14965","snapshot_observed_at":"2026-08-06T04:30:38.938928Z","title":"Killian, Mikhail Yurochkin, Zhengzhong Liu, Eric P","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:38.938928Z"},"links":{"cited_paper":"/paper/2506.14965","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:e7a2a73d16f91851c11868968d1737fc85fa7fbf8154cf055e24c7063c22d10e","observation_id":"e00d57f2-0c17-4e4c-b441-2e87735c546b","resolution":{"observed_at":"2026-08-06T04:30:38.938928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T04:30:39.031956Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:39.031956Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:2c34fb0bf42763dd381f951608db7b2ced31ba8b66977ecb4c2b22163d6f0373","observation_id":"89a2579b-c321-4849-8b09-1032a7c6b001","resolution":{"observed_at":"2026-08-06T04:30:39.031956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:39.141611Z","title":"Metacognitive capabilities of LLMs: An exploration in mathematical problem solving.Advances in Neural Information Processing Systems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:39.141611Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:37dbd2218dd5729766f461d645f536eb3557691233d01ac23c91fcfd75bb589f","observation_id":"ed4106fb-7792-4233-8261-434ad4b6bfd6","resolution":{"observed_at":"2026-08-06T04:30:39.141611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13379","last_updated":"2025-06-26T14:06:49Z","snapshot_observed_at":"2026-08-08T22:27:57.440955Z","submitted_at":"2025-05-19T17:24:16Z","title":"Thinkless: LLM Learns When to Think","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13379","snapshot_observed_at":"2026-08-06T04:30:39.238053Z","title":"Thinkless: LLM learns when to think.arXiv preprint arXiv:2505.13379, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:39.238053Z"},"links":{"cited_paper":"/paper/2505.13379","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:4236c911761b21ac406df9b1afad66d610ba0d1b80d9e81aa215bc5ed647e7b2","observation_id":"4e249b7d-bd6a-40e0-871e-0056f67c682c","resolution":{"observed_at":"2026-08-06T04:30:39.238053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T04:30:39.338585Z","title":"DeepSeek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:39.338585Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:286b5f82b8d2672060c77e8f182c794108b3db00707ee7cace1012f760d09237","observation_id":"74652f66-0821-4cb1-a765-b61f5f08c2e9","resolution":{"observed_at":"2026-08-06T04:30:39.338585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02018","last_updated":"2025-05-04T07:48:36Z","snapshot_observed_at":"2026-08-08T09:28:02.889462Z","submitted_at":"2025-05-04T07:48:36Z","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02018","snapshot_observed_at":"2026-08-06T04:30:39.422268Z","title":"R-Bench: Graduate-level multi-disciplinary benchmarks for LLM & MLLM complex reasoning evaluation.arXiv preprint arXiv:2505.02018, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:39.422268Z"},"links":{"cited_paper":"/paper/2505.02018","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:1d9da8d70badfff039c15fbbe6aa664bd3d4344213246957b1cc062484062a8d","observation_id":"e38f4f09-afe9-4b91-9cad-06f220e0180c","resolution":{"observed_at":"2026-08-06T04:30:39.422268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00147","last_updated":"2025-09-10T22:32:09Z","snapshot_observed_at":"2026-08-15T03:31:24.786088Z","submitted_at":"2025-04-30T19:35:46Z","title":"AdaptMI: Adaptive Skill-based In-context Math Instruction for Small Language Models","version":2},"cited_work":{"arxiv_id":"2505.00147","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.00147","snapshot_observed_at":"2026-08-06T04:30:49.547388Z","title":"AdaptMI: Adaptive Skill-based In-context Math Instruction for Small Language Models","venue":"cs.CL","work_id":"9cfe1381-92a5-4b32-a917-ca33020df9fb","year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:39.563825Z"},"links":{"cited_paper":"/paper/2505.00147","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:c099a3c208ac38db23e1c4f9677f6f7b19c96eb6227002828e4c5799e468a4b4","observation_id":"43c2c010-9b67-4309-a4ea-a3cba7e046f5","resolution":{"observed_at":"2026-08-06T04:30:49.550875Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:39.641296Z","title":"STAT: Skill-targeted adaptive training.arXiv preprint arXiv:2510.10023, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:39.641296Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:eb3c5713ad2b1f4574e869481a38c705396d339c68dc6922da7d1a04aff91629","observation_id":"a21e7b44-59e0-4b5a-b43d-5d0ed2e6e5a6","resolution":{"observed_at":"2026-08-06T04:30:39.641296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12002","last_updated":"2026-06-11T04:21:23Z","snapshot_observed_at":"2026-08-11T06:47:39.541564Z","submitted_at":"2026-04-13T19:46:55Z","title":"Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.12002","snapshot_observed_at":"2026-08-06T04:30:39.705631Z","title":"Self-distillation zero: Self-revision turns binary rewards into dense supervision.arXiv preprint arXiv:2604.12002, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:39.705631Z"},"links":{"cited_paper":"/paper/2604.12002","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:7e2aaf2c06fc208c8aa1281385ee966e10b5289375be71ce7fb7cc7f01cd1c7b","observation_id":"fdfaa97d-e9d8-461e-bef5-8363bdb39ffc","resolution":{"observed_at":"2026-08-06T04:30:39.705631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-06T04:30:39.862494Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:39.862494Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:339a6ad5d591e440ed47d5d71da07aeecbdde22d23a58793638667c3afce8ce8","observation_id":"d40a405c-c813-416e-a2f7-7e2774c6a670","resolution":{"observed_at":"2026-08-06T04:30:39.862494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05257","last_updated":"2026-06-28T17:25:01Z","snapshot_observed_at":"2026-08-14T05:17:05.174902Z","submitted_at":"2025-07-07T17:59:54Z","title":"Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05257","snapshot_observed_at":"2026-08-06T04:30:39.961952Z","title":"Evaluating memory in LLM agents via incremental multi-turn interactions.arXiv preprint arXiv:2507.05257, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:39.961952Z"},"links":{"cited_paper":"/paper/2507.05257","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:2586452b5d3732055e5015ac4a835dd99b35a96b2c9c64f78cfb9fe6963a713d","observation_id":"772fc02a-582d-4e54-b85c-a10830a34981","resolution":{"observed_at":"2026-08-06T04:30:39.961952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:40.042883Z","title":"Open-R1: A fully open reproduction of DeepSeek-R1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:40.042883Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:15b2317afb5a2a4c855f1d93277e3da02c7266b1e5eb1e474e7d57b58f6ba9a4","observation_id":"15ec8f37-481f-4885-b375-d5cad83cc672","resolution":{"observed_at":"2026-08-06T04:30:40.042883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-13T09:04:30.125777Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-06T04:30:40.119348Z","title":"LiveCodeBench: Holistic and contamination free evaluation of large language models for code.arXiv preprint arXiv:2403.07974, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:40.119348Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:9ac023b16b692f3fd934e2871685f56710865070ff1151c0bcd1f36930e8b331","observation_id":"ea8571ec-8a18-4a8d-84f0-c290b8239f7e","resolution":{"observed_at":"2026-08-06T04:30:40.119348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13975","last_updated":"2026-04-24T20:59:42Z","snapshot_observed_at":"2026-08-12T01:15:12.448694Z","submitted_at":"2025-05-20T06:15:15Z","title":"DRP: Distilled Reasoning Pruning with Skill-aware Step Decomposition for Efficient Large Reasoning Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13975","snapshot_observed_at":"2026-08-06T04:30:40.212488Z","title":"DRP: Distilled reasoning pruning with skill-aware step decomposition for efficient large reasoning models.arXiv preprint arXiv:2505.13975, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:40.212488Z"},"links":{"cited_paper":"/paper/2505.13975","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:111542a8818984a73771ac456545bc6f746526f8c6edd659fb317dbad11cfb82","observation_id":"cef7bf9b-2075-44b1-95b1-70fdfc3554a4","resolution":{"observed_at":"2026-08-06T04:30:40.212488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14774","last_updated":"2025-05-28T19:21:23Z","snapshot_observed_at":"2026-08-14T21:46:43.349043Z","submitted_at":"2024-08-27T04:31:58Z","title":"Instruct-SkillMix: A Powerful Pipeline for LLM Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14774","snapshot_observed_at":"2026-08-06T04:30:40.386775Z","title":"Instruct-SkillMix: A powerful pipeline for LLM instruction tuning.arXiv preprint arXiv:2408.14774, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:40.386775Z"},"links":{"cited_paper":"/paper/2408.14774","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:065968c121681513540e2632803a48fb63e7149a86246fc45919298690bef412","observation_id":"eaf7ed6d-2b24-4875-a2cc-0e669720ea6d","resolution":{"observed_at":"2026-08-06T04:30:40.386775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19187","last_updated":"2025-05-06T15:11:32Z","snapshot_observed_at":"2026-08-12T02:14:03.311881Z","submitted_at":"2025-02-26T14:50:50Z","title":"BIG-Bench Extra Hard","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19187","snapshot_observed_at":"2026-08-06T04:30:40.572955Z","title":"Jain, Virginia Aglietti, Disha Jindal, Peter Chen, Nishanth Dikkala, Gladys Tyen, Xin Liu, Uri Shalit, Silvia Chiappa, Kate Olszewska, Yi Tay, Vinh Q","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:40.572955Z"},"links":{"cited_paper":"/paper/2502.19187","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:a977dcdf143450d77fcb2dc1ce2b423ba1c717d3d973b1198fac941b5f90bdab","observation_id":"79592456-402e-4e60-bf62-d166c363c77b","resolution":{"observed_at":"2026-08-06T04:30:40.572955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:40.730539Z","title":"Benchmark profiling: Mechanistic diagnosis of LLM benchmarks.arXiv preprint arXiv:2510.01232, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:40.730539Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:e166cf0fd2453b7c07618e0a501a66215eb2debece402e5db74318e6daa3e484","observation_id":"634ed69b-c440-426e-8986-7e327cee4b8f","resolution":{"observed_at":"2026-08-06T04:30:40.730539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.17628","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:49.317665Z","title":"MSCoRe: A benchmark for multi-stage collaborative reasoning in LLM agents.arXiv preprint arXiv:2509.17628, 2025","venue":null,"work_id":"b0f08b1c-4bae-4f90-bb79-90c12b2b577f","year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:40.868199Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:55b82731e0bc84e82738c5bada0a11e8539158e240f01a3023a374c59bd5e250","observation_id":"c7f1954f-b3c2-46f5-b7cf-9da893fc87d2","resolution":{"observed_at":"2026-08-06T04:30:49.323037Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04625","last_updated":"2025-03-07T18:13:22Z","snapshot_observed_at":"2026-08-12T12:55:25.017700Z","submitted_at":"2025-03-06T17:11:51Z","title":"START: Self-taught Reasoner with Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04625","snapshot_observed_at":"2026-08-06T04:30:41.015987Z","title":"START: Self-taught reasoner with tools.arXiv preprint arXiv:2503.04625, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:41.015987Z"},"links":{"cited_paper":"/paper/2503.04625","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:d65406d568c318bd799638f923b7a77cf3c0e8e2a80fd2c5f0d8ba080ee0d298","observation_id":"8c72a2b4-2d84-42ef-aa85-1ee0fb024670","resolution":{"observed_at":"2026-08-06T04:30:41.015987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12670","last_updated":"2026-03-13T07:33:01Z","snapshot_observed_at":"2026-08-12T09:12:28.700231Z","submitted_at":"2026-02-13T07:06:06Z","title":"SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12670","snapshot_observed_at":"2026-08-06T04:30:41.170677Z","title":"SkillsBench: Benchmarking how well agent skills work across diverse tasks.arXiv preprint arXiv:2602.12670, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:41.170677Z"},"links":{"cited_paper":"/paper/2602.12670","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:fabd1bd7de3729095fa64284725b38d9e7da029991ad0fb5d8d89820927d04d0","observation_id":"bc749d60-dded-40be-b893-bf3265216b73","resolution":{"observed_at":"2026-08-06T04:30:41.170677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:41.324235Z","title":"Benchmark test-time scaling of general LLM agents.arXiv preprint arXiv:2602.18998, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:41.324235Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:4796c300567e3c37b1174253ebf9aabca21b01533e6d16aa1a58a663ccc4c77d","observation_id":"b6b5672e-cab7-459a-bf83-17daea23ab7b","resolution":{"observed_at":"2026-08-06T04:30:41.324235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17123","last_updated":"2026-05-21T12:25:44Z","snapshot_observed_at":"2026-08-14T05:22:26.374179Z","submitted_at":"2025-05-21T17:59:12Z","title":"MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17123","snapshot_observed_at":"2026-08-06T04:30:41.455573Z","title":"MTR-Bench: A comprehensive benchmark for multi-turn reasoning evaluation.arXiv preprint arXiv:2505.17123, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:41.455573Z"},"links":{"cited_paper":"/paper/2505.17123","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:91700ac0cb0e8ed4c02f6ec6e219a5619d354c41d88cc52a75ce1160b931140a","observation_id":"7f1b4aa7-6cba-4dd4-972b-d20686689bf4","resolution":{"observed_at":"2026-08-06T04:30:41.455573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-11T17:22:43.545531Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-06T04:30:41.616138Z","title":"Let’s verify step by step.arXiv preprint arXiv:2305.20050, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:41.616138Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:df24666c222effe1792265ed75dfabc805e14021212de88135fb2c0920cd328f","observation_id":"d1a728ed-df21-49e1-950f-bbadfa80112b","resolution":{"observed_at":"2026-08-06T04:30:41.616138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01100","last_updated":"2025-07-15T01:14:25Z","snapshot_observed_at":"2026-08-11T01:11:37.606065Z","submitted_at":"2025-02-03T06:44:49Z","title":"ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01100","snapshot_observed_at":"2026-08-06T04:30:41.776241Z","title":"ZebraLogic: On the scaling limits of LLMs for logical reasoning.arXiv preprint arXiv:2502.01100, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:41.776241Z"},"links":{"cited_paper":"/paper/2502.01100","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:2ed48592dcfa61cb367e2592287d3a40a38e27aed33a84d0ad8b39041742f4f1","observation_id":"cad6590c-cf1c-48fa-a5a2-3e51e0b2dc1d","resolution":{"observed_at":"2026-08-06T04:30:41.776241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-13T14:09:17.964744Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-08-06T04:30:41.907092Z","title":"AgentBench: Evaluating LLMs as agents.arXiv preprint arXiv:2308.03688, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:41.907092Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:2f79455015dbd3adcabdde60b5c93c2acdd19a85da455965f0080bda3ebc2d73","observation_id":"a80a4082-64be-48d1-b0ba-890af7af79d9","resolution":{"observed_at":"2026-08-06T04:30:41.907092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12983","last_updated":"2023-11-21T20:34:47Z","snapshot_observed_at":"2026-08-13T10:06:26.439949Z","submitted_at":"2023-11-21T20:34:47Z","title":"GAIA: a benchmark for General AI Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12983","snapshot_observed_at":"2026-08-06T04:30:42.065260Z","title":"GAIA: A benchmark for general AI assistants.arXiv preprint arXiv:2311.12983, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:42.065260Z"},"links":{"cited_paper":"/paper/2311.12983","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:3befa71c93cb37a41691cca6a8f5b396069dcc849521dcf9f5416958c3eee4d9","observation_id":"5a04cf71-b807-41e6-aed6-8baef6e5fe51","resolution":{"observed_at":"2026-08-06T04:30:42.065260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12841","last_updated":"2024-12-17T12:10:38Z","snapshot_observed_at":"2026-08-11T13:38:21.194747Z","submitted_at":"2024-12-17T12:10:38Z","title":"Benchmarking and Understanding Compositional Relational Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2412.12841","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.12841","snapshot_observed_at":"2026-08-06T04:30:49.091477Z","title":"Benchmarking and Understanding Compositional Relational Reasoning of LLMs","venue":"cs.CL","work_id":"305aa6fd-70fc-4330-b5b0-e6aa03f0bbc0","year":2024},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:42.215749Z"},"links":{"cited_paper":"/paper/2412.12841","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:5d1c229c805bc863c9ebf52a5e6b60dd31b1b4472be68836b3449f248c25c6ae","observation_id":"a0bb827e-e8e3-4fb8-9109-87a6f223097e","resolution":{"observed_at":"2026-08-06T04:30:49.095104Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:42.370880Z","title":"Reasoning curriculum: Bootstrapping broad LLM reasoning from math.arXiv preprint arXiv:2510.26143, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:42.370880Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:8920091983df86303303febb0b5f6ed8de935660f51d15928080652b0bc72147","observation_id":"c135f8fc-0df8-42c5-849d-509b8887d953","resolution":{"observed_at":"2026-08-06T04:30:42.370880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.00305","last_updated":"2015-08-03T02:53:01Z","snapshot_observed_at":"2026-08-14T22:37:58.869559Z","submitted_at":"2015-08-03T02:53:01Z","title":"Compositional Semantic Parsing on Semi-Structured Tables","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.00305","snapshot_observed_at":"2026-08-06T04:30:42.504186Z","title":"Compositional semantic parsing on semi-structured tables","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:42.504186Z"},"links":{"cited_paper":"/paper/1508.00305","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:1815a40bf5a0de41de07ffb5f86aa972469ad5f4966791c0bf457f0a4043eb8a","observation_id":"263f343b-08a9-4a51-abf6-b814cf1ab837","resolution":{"observed_at":"2026-08-06T04:30:42.504186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:42.598191Z","title":"Learning to reason across parallel samples for LLM reasoning.arXiv preprint arXiv:2506.09014, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:42.598191Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:248011a35b38da59c83ee64afe87d51c62a4efa471db548c1f959f1fc33eabe2","observation_id":"d070f3e4-b2fb-4427-96fe-6e06ad3690c8","resolution":{"observed_at":"2026-08-06T04:30:42.598191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:42.722899Z","title":"EmoAgent: Assessing and safeguarding human-AI interaction for mental health safety","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:42.722899Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:a72d31380f47e1396baa2600e82964266aeb8ac79c520ee04dc014cbc5c25159","observation_id":"d5fb6985-d76d-40f3-a2a0-a51a09c8b4e2","resolution":{"observed_at":"2026-08-06T04:30:42.722899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.06533","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:48.911000Z","title":"LogicSkills: A structured benchmark for formal reasoning in large language models.arXiv preprint arXiv:2602.06533, 2026","venue":null,"work_id":"cfb5864b-f5fd-49da-9c4b-2d839a4447d9","year":2026},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:42.911167Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:f1f0847db0664b5dd2eb90e8f7606342329c2f0af2c6daccfb52bb26ddc5d7fb","observation_id":"47ee61b7-1e6d-428b-8a50-87643f3dfebc","resolution":{"observed_at":"2026-08-06T04:30:48.916500Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:43.060338Z","title":"Reasoning models are test exploiters: Rethinking multiple-choice.arXiv preprint arXiv:2507.15337, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:43.060338Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:6f4330580f170597098f38c209ffed35a04ef9ae8bc27b439cf5eca01fd0eb2b","observation_id":"5bb94826-154a-4760-abbf-48449447200f","resolution":{"observed_at":"2026-08-06T04:30:43.060338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15629","last_updated":"2025-06-18T17:00:54Z","snapshot_observed_at":"2026-08-12T07:13:19.151512Z","submitted_at":"2025-06-18T17:00:54Z","title":"Revisiting Compositional Generalization Capability of Large Language Models Considering Instruction Following Ability","version":1},"cited_work":{"arxiv_id":"2506.15629","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.15629","snapshot_observed_at":"2026-08-06T04:30:48.754585Z","title":"Revisiting Compositional Generalization Capability of Large Language Models Considering Instruction Following Ability","venue":"cs.CL","work_id":"49cd7f86-0017-4e63-ab20-d5e3581d4865","year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:43.189580Z"},"links":{"cited_paper":"/paper/2506.15629","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:77b31827ef27b26eb1170ceb831e8cfc671cf1f0a89d636a5a8a0457a6ab88f3","observation_id":"10a0be47-6ecc-48d0-9f7c-af1da1abf9c6","resolution":{"observed_at":"2026-08-06T04:30:48.758172Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21009","last_updated":"2025-02-03T12:53:41Z","snapshot_observed_at":"2026-08-12T23:11:48.486636Z","submitted_at":"2024-07-30T17:55:36Z","title":"AI-Assisted Generation of Difficult Math Questions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21009","snapshot_observed_at":"2026-08-06T04:30:43.301574Z","title":"AI-assisted generation of difficult math questions.arXiv preprint arXiv:2407.21009, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:43.301574Z"},"links":{"cited_paper":"/paper/2407.21009","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:28e74b2a234b3fe3fad5ec073b2800bd26aff9a4c26c5fa89f2babe97da39375","observation_id":"3769a8a2-921a-42ea-a2ef-7aab904d3024","resolution":{"observed_at":"2026-08-06T04:30:43.301574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T04:30:43.408023Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:43.408023Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:8ec801baf80c4a5e329560813b9ca9780b81c2f6f085fbe0acc795b37e387e52","observation_id":"47094969-dc1f-4766-9d03-82be32a2124c","resolution":{"observed_at":"2026-08-06T04:30:43.408023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.24288","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:48.711032Z","title":"DARE- bench: Evaluating modeling and instruction fidelity of LLMs in data science.arXiv preprint arXiv:2602.24288, 2026","venue":null,"work_id":"55e938f9-119e-4129-b6f3-2f27e447b34b","year":2026},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:43.543973Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:87382f146faac301d8d63de3bcee30f35cb35dfb32ca5d75313809763c2981f4","observation_id":"fd41d836-26bf-4ccb-8a8d-7e2b61b4918a","resolution":{"observed_at":"2026-08-06T04:30:48.717785Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-06T04:30:43.695729Z","title":"PaperBench: Evaluating AI’s ability to replicate AI research.arXiv preprint arXiv:2504.01848, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:43.695729Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:ad529f194fc1c972e317b38daf80964412e35d9aa0c0cffcde316345ad33961e","observation_id":"6c3ae39e-671d-4674-a715-775352b9cce4","resolution":{"observed_at":"2026-08-06T04:30:43.695729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-06T04:30:43.796711Z","title":"Challenging BIG-Bench tasks and whether chain-of-thought can solve them.arXiv preprint arXiv:2210.09261, 2022","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:43.796711Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:df1547aac3568be989d48c6ff6842506517fba913c40afd26b8347787788de3a","observation_id":"705f7630-3321-4561-bf0d-3c7c08bd223a","resolution":{"observed_at":"2026-08-06T04:30:43.796711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.17102","last_updated":"2026-03-10T05:40:56Z","snapshot_observed_at":"2026-08-15T01:29:41.879292Z","submitted_at":"2025-12-18T21:58:19Z","title":"Reinforcement Learning for Self-Improving Agent with Skill Library","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.17102","snapshot_observed_at":"2026-08-06T04:30:43.949208Z","title":"Reinforcement learning for self-improving agent with skill library.arXiv preprint arXiv:2512.17102, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:43.949208Z"},"links":{"cited_paper":"/paper/2512.17102","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:24e540500a0196da526f3a462880a2c83df29b2836f9d75d201932178399ead2","observation_id":"7834b505-9f05-4d7a-8e38-ead4733a71c1","resolution":{"observed_at":"2026-08-06T04:30:43.949208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-08-14T10:08:59.886019Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-06T04:30:44.073590Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:44.073590Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:d6e34843286816d0050491f6499402076c921592e97ec96a48e040207eda9b0d","observation_id":"a28e7c8e-8e10-49e3-937b-da961f2cf94c","resolution":{"observed_at":"2026-08-06T04:30:44.073590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-08-06T17:04:47.204008Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-08-06T04:30:44.200213Z","title":"OdysseyBench: Evaluating LLM agents on long-horizon complex office application workflows","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:44.200213Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:2588e06d2bf58e17313f486bd2d0f65b80546a4700e9c70fb6412a70ce07e623","observation_id":"9eac2e05-e348-4e38-86bb-fc182ea509c7","resolution":{"observed_at":"2026-08-06T04:30:44.200213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-06T04:30:44.345592Z","title":"MMLU-Pro: A more robust and challenging multi-task language understanding benchmark.arXiv preprint arXiv:2406.01574, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:44.345592Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:e0982bcecac5f397000a2c38ee8b1fc69a80b9e1f87e5f02e6db509e115d33b9","observation_id":"05187c29-552d-42d3-83c5-fd0d9b42a8ec","resolution":{"observed_at":"2026-08-06T04:30:44.345592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:44.416172Z","title":"Reinforcingmulti-turn reasoning in LLM agents via turn-level reward design.arXiv preprint arXiv:2505.11821, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:44.416172Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:4f85a31c9b4f724f55d6061571f0fe51312e4c039bb7a7a87dd112bbdc9d89ed","observation_id":"aa1f2ede-0d00-40fd-92b6-f54e5b855943","resolution":{"observed_at":"2026-08-06T04:30:44.416172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.03676","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:48.491457Z","title":"Towardscompositionalgeneralization of LLMs via skill taxonomy guided data synthesis.arXiv preprint arXiv:2601.03676, 2026","venue":null,"work_id":"74ae11d5-f45c-4789-ac94-abe78bc70380","year":2026},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:44.481066Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:2a522aadc09877a66738b5d6aa426619fd646309708391e6bacb1c22b67ad898","observation_id":"fb388906-b5c2-4b7d-8ce8-4ffefc7cc252","resolution":{"observed_at":"2026-08-06T04:30:48.497373Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:44.546621Z","title":"Hi-ToM: A benchmark for evaluating higher-order theory of mind reasoning in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:44.546621Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:1c5223c3fa11df61cba973062fb4df7e882fae726f91b93fd976474f22f3504a","observation_id":"b0e4634c-9404-4cd6-a681-ab2c31072565","resolution":{"observed_at":"2026-08-06T04:30:44.546621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:44.623109Z","title":"CritICL: Inference-time weak-to-strong generalization from small language model failure modes","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:44.623109Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:a1254b60b7034254d902c97f92cd39132e14221586a8f86127aecdb784e6706e","observation_id":"81e1505c-7efa-49cc-9bca-9615802b1c9b","resolution":{"observed_at":"2026-08-06T04:30:44.623109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:44.689567Z","title":"SkillRL: Evolving agents via recursive skill-augmented reinforcement learning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:44.689567Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:c427e91769a1aadbeef6e52a9afeaab59e398ff95a36cb575adaff9a6b41e988","observation_id":"564db2cd-3f30-4d90-aa42-6f26843d43a8","resolution":{"observed_at":"2026-08-06T04:30:44.689567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04684","last_updated":"2025-06-20T16:50:07Z","snapshot_observed_at":"2026-08-14T13:43:40.409458Z","submitted_at":"2023-12-07T20:36:10Z","title":"LaRS: Latent Reasoning Skills for Chain-of-Thought Reasoning","version":4},"cited_work":{"arxiv_id":"2312.04684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.04684","snapshot_observed_at":"2026-08-06T04:30:48.423198Z","title":"LaRS: Latent Reasoning Skills for Chain-of-Thought Reasoning","venue":"cs.CL","work_id":"a05ac6ad-ae50-4c7a-96b0-c4e5e55fc1af","year":2023},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:44.748285Z"},"links":{"cited_paper":"/paper/2312.04684","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:6380c28133f9ddc9073485a2d0bf8dff735abba60df411fc2065d05ddab37781","observation_id":"4e35a80f-b213-4d98-93a5-f462b54b3f1b","resolution":{"observed_at":"2026-08-06T04:30:48.427051Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00662","last_updated":"2025-05-01T17:03:17Z","snapshot_observed_at":"2026-08-07T15:57:19.356999Z","submitted_at":"2025-05-01T17:03:17Z","title":"DeepCritic: Deliberate Critique with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00662","snapshot_observed_at":"2026-08-06T04:30:44.844166Z","title":"DeepCritic: Deliberate critique with large language models.arXiv preprint arXiv:2505.00662, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:44.844166Z"},"links":{"cited_paper":"/paper/2505.00662","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:c502ccb1253852d1267db9a3a1a97b59b17afc05abecffc7a9811cbd8bd754b6","observation_id":"4be92d90-751e-4fa9-88f4-907765b67579","resolution":{"observed_at":"2026-08-06T04:30:44.844166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.25178","last_updated":"2026-06-27T02:34:55Z","snapshot_observed_at":"2026-08-14T23:27:30.054684Z","submitted_at":"2026-06-23T21:10:29Z","title":"Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR","version":2},"cited_work":{"arxiv_id":"2606.25178","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.25178","snapshot_observed_at":"2026-08-06T04:30:48.395226Z","title":"Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR","venue":"cs.AI","work_id":"83bf47fb-00ea-40e1-bbe7-a4ae632b630a","year":2026},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:44.909089Z"},"links":{"cited_paper":"/paper/2606.25178","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:e8a6fbc1bf6cc351ab42b6419f307c03d38b6a0fe2b3b5fd125bc8083f50f57f","observation_id":"5fdab5d0-8554-4199-93e0-da0123f8527f","resolution":{"observed_at":"2026-08-06T04:30:48.399971Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:44.984844Z","title":"LongProc: Benchmarking long-context language models on long procedural generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:44.984844Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:6e234b3aae407a4cd8bb79f2d205fa33446a4dafa00794c332a8fc09fa27ca07","observation_id":"4f045811-840f-41c5-a0ce-eebebd0315f5","resolution":{"observed_at":"2026-08-06T04:30:44.984844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17567","last_updated":"2023-10-26T16:55:05Z","snapshot_observed_at":"2026-08-14T09:29:06.512962Z","submitted_at":"2023-10-26T16:55:05Z","title":"Skill-Mix: a Flexible and Expandable Family of Evaluations for AI models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17567","snapshot_observed_at":"2026-08-06T04:30:45.049452Z","title":"Skill-Mix: A flexible and expandable family of evaluations for AI models.arXiv preprint arXiv:2310.17567, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:45.049452Z"},"links":{"cited_paper":"/paper/2310.17567","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:fe587ac2cf12e6b2e68724893fc3c362cd9707a625ad1a53226b296161b34be9","observation_id":"8eb82e20-7176-43d1-a1af-6dfee17fb294","resolution":{"observed_at":"2026-08-06T04:30:45.049452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:45.118337Z","title":"From𝑓(𝑥) and 𝑔(𝑥) to 𝑓(𝑔(𝑥)) : LLMs learn new skills in RL by composing old ones.arXiv preprint arXiv:2509.25123, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:45.118337Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:bf7fc4d21dc5354c692637532407435f84ee30cf62c48802b74f290dba1b6c0a","observation_id":"ba4c8a55-fae2-4392-a94e-b9b9559cf248","resolution":{"observed_at":"2026-08-06T04:30:45.118337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:45.193661Z","title":"Skill-aware data selection and fine-tuning for data-efficient reasoning distillation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:45.193661Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:4be1db11e0e3ad481350900c27f82eae72e7fc3be5e7e1ad939ebed50fcb8e56","observation_id":"4f441f9d-74ea-40fd-baaf-85ae5922310c","resolution":{"observed_at":"2026-08-06T04:30:45.193661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.10109","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:48.152356Z","title":"Skill-awaredataselectionandfine-tuning for data-efficient reasoning distillation, 2026","venue":null,"work_id":"1a1d5a96-5b04-425b-8e64-dbebe9adc11b","year":2026},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:45.286495Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:6b8ab97616cb66399d44c2b704498c0a7a7e22a212e038390f250cb60dde6f94","observation_id":"7ecd2ff6-3be4-4195-b060-beed5ce26159","resolution":{"observed_at":"2026-08-06T04:30:48.157980Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:45.384534Z","title":"Lee, Chenlei Leng, and Fanghui Liu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:45.384534Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:e095a7e1a0cac1abe623de3634df79b784c04cc27f0a2f2f3e5898e1314d7854","observation_id":"9b43e4de-0cd7-482c-9948-122df95a7a07","resolution":{"observed_at":"2026-08-06T04:30:45.384534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-06T04:30:45.506154Z","title":"RLVMR: Reinforcement learning with verifiable meta-reasoning rewards for robust long-horizon agents.arXiv preprint arXiv:2507.22844, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:45.506154Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:8865e9b8673b2e88094b21150c56410cf1f9e4594016e441b542ee1962bd4079","observation_id":"0506bd30-63bc-448a-84f7-bf8d05965137","resolution":{"observed_at":"2026-08-06T04:30:45.506154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19808","last_updated":"2025-01-19T02:31:24Z","snapshot_observed_at":"2026-08-12T22:35:02.788737Z","submitted_at":"2024-09-29T22:14:02Z","title":"Can Models Learn Skill Composition from Examples?","version":2},"cited_work":{"arxiv_id":"2409.19808","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.19808","snapshot_observed_at":"2026-08-06T04:30:47.834479Z","title":"Can Models Learn Skill Composition from Examples?","venue":"cs.CL","work_id":"9df761c9-1bdb-4211-8a82-a305650c614e","year":2024},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:45.607770Z"},"links":{"cited_paper":"/paper/2409.19808","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:e579446439ab6513cd20ec64eb5b7bda2e74e44f867fec870a13a1464c79153e","observation_id":"985fb27d-d840-456c-bdf2-e1b7307a67ec","resolution":{"observed_at":"2026-08-06T04:30:47.894990Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08049","last_updated":"2026-04-29T02:51:24Z","snapshot_observed_at":"2026-07-06T22:32:07.945004Z","submitted_at":"2025-10-09T10:35:31Z","title":"A Survey of Process Reward Models: From Outcome Signals to Process Supervisions for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.08049","snapshot_observed_at":"2026-08-06T04:30:45.669787Z","title":"A survey of process reward models: From outcome signals to process supervisions for large language models.arXiv preprint arXiv:2510.08049, 2025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:45.669787Z"},"links":{"cited_paper":"/paper/2510.08049","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:cdf16f88ba1d54d2efd4d1bd62d431d9347284cde3a62ede51793ee177e77553","observation_id":"51c4fc5c-8ba0-4182-8d2b-6574abb25afd","resolution":{"observed_at":"2026-08-06T04:30:45.669787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04520","last_updated":"2024-06-06T21:27:35Z","snapshot_observed_at":"2026-08-12T23:48:20.301212Z","submitted_at":"2024-06-06T21:27:35Z","title":"NATURAL PLAN: Benchmarking LLMs on Natural Language Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04520","snapshot_observed_at":"2026-08-06T04:30:45.725769Z","title":"NATURAL PLAN: Benchmarking LLMs on natural language planning.arXiv preprint arXiv:2406.04520, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:45.725769Z"},"links":{"cited_paper":"/paper/2406.04520","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:69e6d515de1ae1f41ee93e6765cbd10545f7adb412a553164ffccd483d604437","observation_id":"c0bce8bd-4215-492e-b0f8-185d3f0d0725","resolution":{"observed_at":"2026-08-06T04:30:45.725769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.22455","last_updated":"2026-07-20T07:40:09Z","snapshot_observed_at":"2026-08-13T14:10:01.327731Z","submitted_at":"2026-03-23T18:23:59Z","title":"SkillRouter: Skill Routing for LLM Agents at Scale","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.22455","snapshot_observed_at":"2026-08-06T04:30:45.785107Z","title":"SkillRouter: Skill routing for LLM agents at scale.arXiv preprint arXiv:2603.22455, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:45.785107Z"},"links":{"cited_paper":"/paper/2603.22455","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:036dca135ae88968bc881c55bbefffef4304c89bb9f77603f22946156cfa206b","observation_id":"3be68408-0eae-4f51-8cee-15b8fb01407e","resolution":{"observed_at":"2026-08-06T04:30:45.785107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.20087","last_updated":"2026-04-22T01:07:37Z","snapshot_observed_at":"2026-08-15T05:12:26.979135Z","submitted_at":"2026-04-22T01:07:37Z","title":"SkillLearnBench: Benchmarking Continual Learning Methods for Agent Skill Generation on Real-World Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.20087","snapshot_observed_at":"2026-08-06T04:30:45.842422Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:45.842422Z"},"links":{"cited_paper":"/paper/2604.20087","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:42f1606cf87392028ac04a18ddc5be670366f2938453d2e54ead95adbb871d8c","observation_id":"f26bf2fa-4768-4abe-a813-b75e88bafcd9","resolution":{"observed_at":"2026-08-06T04:30:45.842422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:49.924211Z","title":"It clearly outlines the key factors and their interrelationships","venue":null,"work_id":"caf04b60-04cf-4130-b343-7511cda596e3","year":null},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:45.896367Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:654799bd5777717523b8759f7d8574ba12eeab8f30317c7090ca72f46645693d","observation_id":"63be7e85-8388-469b-a518-0c586be89495","resolution":{"observed_at":"2026-08-06T04:30:49.927126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:49.914741Z","title":"Specific examples from the data are used to support the narrative","venue":null,"work_id":"0c6ef945-eeac-4502-9bdb-e4828c6c0d60","year":null},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:45.957925Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:e4e35aeb0d2f5004964cdab108590488e77c36abb3271cd8c16f2b1b89a85a02","observation_id":"d34e5cd0-02c8-4f10-990b-62371eb35b0e","resolution":{"observed_at":"2026-08-06T04:30:49.918035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:49.905757Z","title":"It captures the reader’s interest and effectively conveys the potential crisis","venue":null,"work_id":"ee7e7985-49ce-4c9a-a150-4b67a5823745","year":null},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:46.040304Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:80bdfd8873d56417c356adc5d7db22ab46888d183daad0aef9650c96803769e7","observation_id":"72849c37-fbd7-4519-87c9-f82842a368fb","resolution":{"observed_at":"2026-08-06T04:30:49.909058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:49.896949Z","title":"It uses the data and insights from the previous steps to construct a plausible and coherent narrative","venue":null,"work_id":"64779ffb-6b40-4263-9a01-e2cdc574a31c","year":null},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:46.110513Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:ce9e46b73688681871d710729a699b6c42a915863cd7430a65a339a0545de705","observation_id":"46ee3a08-804c-4b2e-a87f-28fe61b52bd8","resolution":{"observed_at":"2026-08-06T04:30:49.900061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:49.887829Z","title":"It should reflect the brand’s commitment to sustainability","venue":null,"work_id":"1156f587-58a1-4b06-9c67-075462c87cce","year":null},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:46.212338Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:7a7566885d17d0df0a1426c9c8f915e4267ec6c6f147fb53a2901d97c67a6d9d","observation_id":"7d98e6aa-0390-4d6f-b55d-63eab9cd9a22","resolution":{"observed_at":"2026-08-06T04:30:49.890925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:49.878401Z","title":"It should not exceed 10 words","venue":null,"work_id":"ef6f39c1-e8cb-433a-9cd4-85b607518102","year":null},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:46.277290Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:341d4ce6aa1d3a6e9b6b0b70a53d7f2a164b4a391ea6ac443636429a8210b295","observation_id":"862d3e81-c652-41de-a436-10c783881f85","resolution":{"observed_at":"2026-08-06T04:30:49.881322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:49.869496Z","title":null,"venue":null,"work_id":"8d1a253b-edee-44df-a4cf-66ef68fcec80","year":null},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:46.369607Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:ed9d1a8ab38125e1764c7d8c5aef97927b45569a182dd39df5422e1b514cbffe","observation_id":"66e12a0b-a7d2-4dd0-bfe5-a948738e9651","resolution":{"observed_at":"2026-08-06T04:30:49.872486Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:49.860532Z","title":"no-interference","venue":null,"work_id":"90d9435c-4650-4e35-b7e9-3c829f831ab5","year":null},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:46.432911Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:9e32ad384d93c5d3317fa42d4fa83914bb82e674719564db6c71a148222ff99a","observation_id":"8fa281e4-6a35-4557-93b4-bf1458f388eb","resolution":{"observed_at":"2026-08-06T04:30:49.863445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:49.851954Z","title":"DON’T CHANGE THE ANSWER, CORE LOGIC, OR THE SKILL REQUIRED","venue":null,"work_id":"a08b6c1f-9475-42e2-957e-624b5ec03086","year":null},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:46.473121Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:a807405ff378797298128ae3738cd6fe194cc8fc4e6effb4007b3e21064cf68f","observation_id":"505dddaa-bfa2-4486-a3a7-529a6a92c816","resolution":{"observed_at":"2026-08-06T04:30:49.854613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:49.843506Z","title":null,"venue":null,"work_id":"a7a1d8aa-fc61-446e-9f22-7a511c2a5c22","year":null},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:46.578880Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:ac46b319324ba005d057a3324b2b339cf933f092cba9e19f35de3102b734c025","observation_id":"aa927f39-65d7-40ad-a2d1-8e1547e1ae1b","resolution":{"observed_at":"2026-08-06T04:30:49.846320Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:49.833211Z","title":"Conference trip on constraints","venue":null,"work_id":"34f1100d-8219-4220-8788-9045ee4e3d26","year":null},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:46.749688Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:a9a625c0a3a5e22f11b63a7f573fc9fd12cd3788d6f5a418dcb31a12263f1775","observation_id":"97a2f555-a3a9-47c6-954f-b3375f1ef442","resolution":{"observed_at":"2026-08-06T04:30:49.837044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:49.823700Z","title":"29 Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning 2.Scenario consistent.All rewritten steps plausibly belong to the samescenario","venue":null,"work_id":"73f9b8c3-c95c-47e8-8e0a-93cd80400be8","year":null},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:46.966544Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:09bb9926e571b45dfdb4b8c87d8f6c34186be97428829350028b8f69600887ea","observation_id":"6c420ad5-44a8-4954-8aef-9be629177b9d","resolution":{"observed_at":"2026-08-06T04:30:49.826925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:49.813484Z","title":"The core logic, numerical values, and (for multiple-choice) the option letters and contents must be unchanged","venue":null,"work_id":"705a0a16-bdfe-45c2-b592-3e6d477bca0e","year":null},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:47.080943Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:d46a24368b69577644d5c9a67093cc247d69e76181f863816bd26ee544fdfcbe","observation_id":"d60813c5-b66b-44ed-8dd6-4bcb8aca68b5","resolution":{"observed_at":"2026-08-06T04:30:49.817051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:49.803168Z","title":"FAIL if any step references entities, settings, or framings that contradict the scenario or that read as an unrelated problem pasted in","venue":null,"work_id":"3d00d8cc-8f82-4836-ba72-d88822fa0eb9","year":null},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:47.257228Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:173bfcba97c83e7c82dbf0057ee4f02f18e3eb2a24b14c51ab86f30414af63b4","observation_id":"b72f18a9-bb5b-4b8c-88c0-516cb43f235d","resolution":{"observed_at":"2026-08-06T04:30:49.806753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:49.792852Z","title":"using the value from the previous step","venue":null,"work_id":"601341f7-50f8-4e14-a944-1eef46276a45","year":null},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:47.390521Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:9e6f313efb88c9aa3d3711802433dbe9ad0a4a0616b89a705811229d4b3594f0","observation_id":"a66d5167-c914-4613-9b2f-da05bec9d10b","resolution":{"observed_at":"2026-08-06T04:30:49.796334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:49.781990Z","title":"MAE” is the mean absolute error between the LLM and mean human score in[0, 1]. “Binary agree","venue":null,"work_id":"376a9188-f618-421b-a299-f85793c4d284","year":null},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:47.578235Z"},"links":{"citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:4aa0de177360b863de32c6ed2463eb8c41d9c59d0ba670b57a971b31ec2e88e6","observation_id":"37ee22a3-c1f0-4ec2-9688-1ceb5fef7fab","resolution":{"observed_at":"2026-08-06T04:30:49.786033Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T15:04:25.324687Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":60,"verified_exact":13,"verified_fuzzy":13},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 0 inbound Pith citation observations for arXiv:2608.05139."}