{"as_of":"2026-08-14T09:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2d1bbd19f37569295625ebc0aee09eb100829ff7f81ae1fdc6a8cf1f68ee735d","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:34:39.654749Z","state":"measured"},{"denominator":106,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":106,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:45:25.443825Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T17:27:15.209497Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-08-04T16:07:41.188704Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-12T18:46:01.485214Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":168,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:41.188704Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:d4a420427e8f71b6743662175705dfdf3397a33f1895f39591b3ba53c4f7c4b4","observation_id":"c25419ac-312a-4ceb-9052-c9ddd08b8728","resolution":{"observed_at":"2026-08-04T16:07:41.188704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-08-03T20:52:50.977196Z","title":"Ego-r1: Chain-of-tool- thought for ultra-long egocentric video reasoning.arXiv preprint arXiv:2506.13654, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:50.977196Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:f0fd17f600dbdb9a40a8c9b7be78c133f3a4a20ebb9956cad677edb37b9d682c","observation_id":"2022245b-8ebf-44c5-a174-e9fc4f57cea2","resolution":{"observed_at":"2026-08-03T20:52:50.977196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":"2506.13654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-07-02T17:27:15.209497Z","title":"Qwen3.5-omni technical report, 2026a","venue":null,"work_id":"530e118a-54d5-4bd0-a0cc-13fe5e98eda5","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-08-12T14:21:45.818304Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:b4ed0784dc8e1368bfd51d59edcfe3e0f62b268b595a67b6c6a8ef7cb2386975","observation_id":"25424899-9b6f-4a06-8cc5-23aa0f89dd3c","resolution":{"observed_at":"2026-05-22T12:31:32.236221Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":"2506.13654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-07-02T17:27:15.209497Z","title":"Qwen3.5-omni technical report, 2026a","venue":null,"work_id":"530e118a-54d5-4bd0-a0cc-13fe5e98eda5","year":2025},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-17T03:09:31.161760Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:53f0b208ffd50094eeb4422995a86ec47ccf8daca0a12208184bc5e3b33ca363","observation_id":"b03987c0-a1a7-4d17-b4a9-0ae72a77f23b","resolution":{"observed_at":"2026-05-17T03:11:30.127539Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-08-03T18:51:47.364014Z","title":"Ego-r1: Chain-of-tool- thought for ultra-long egocentric video reasoning.arXiv preprint arXiv:2506.13654, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:47.364014Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:e52d712610bb3ec0ffc251fdbbc6e01ce82f737797847dadad67e952baef6574","observation_id":"366d7f97-a531-4eea-8862-d05cbf46d5bc","resolution":{"observed_at":"2026-08-03T18:51:47.364014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":"2506.13654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-07-02T17:27:15.209497Z","title":"Qwen3.5-omni technical report, 2026a","venue":null,"work_id":"530e118a-54d5-4bd0-a0cc-13fe5e98eda5","year":2025},"citing_paper":{"arxiv_id":"2602.20913","last_updated":"2026-04-15T16:09:22Z","snapshot_observed_at":"2026-08-11T11:51:37.712014Z","submitted_at":"2026-02-24T13:49:47Z","title":"LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-15T20:01:31.129959Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2602.20913"},"observation_digest":"sha256:80c5ed008274c5ee01496acbf68d63d48efe5e6a837a4c60c44680867cf0f4ec","observation_id":"0a6561cf-1670-4043-9c5b-917a27057784","resolution":{"observed_at":"2026-05-15T20:01:33.571971Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":"2506.13654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-07-02T17:27:15.209497Z","title":"Qwen3.5-omni technical report, 2026a","venue":null,"work_id":"530e118a-54d5-4bd0-a0cc-13fe5e98eda5","year":2025},"citing_paper":{"arxiv_id":"2604.05015","last_updated":"2026-04-06T17:59:56Z","snapshot_observed_at":"2026-08-11T05:50:34.916262Z","submitted_at":"2026-04-06T17:59:56Z","title":"Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T18:47:32.778695Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2604.05015"},"observation_digest":"sha256:72f9e9066444c1cd9dd2def043f0e77088c8f87d564d4a4e2072b4f17b7c5102","observation_id":"1b19dd71-4df7-4e16-8470-2e82d041f4d5","resolution":{"observed_at":"2026-05-10T23:55:51.234332Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":"2506.13654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-07-02T17:27:15.209497Z","title":"Qwen3.5-omni technical report, 2026a","venue":null,"work_id":"530e118a-54d5-4bd0-a0cc-13fe5e98eda5","year":2025},"citing_paper":{"arxiv_id":"2604.14520","last_updated":"2026-04-16T01:21:14Z","snapshot_observed_at":"2026-08-14T06:53:31.710132Z","submitted_at":"2026-04-16T01:21:14Z","title":"Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T12:05:54.551728Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2604.14520"},"observation_digest":"sha256:b1e077ef3b57f752bf61efc20b468c7794999b3e7377cafaec447dc2451de4d8","observation_id":"764be880-7bed-4ff1-91da-956030d866be","resolution":{"observed_at":"2026-05-10T12:10:22.165296Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":"2506.13654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-07-02T17:27:15.209497Z","title":"Qwen3.5-omni technical report, 2026a","venue":null,"work_id":"530e118a-54d5-4bd0-a0cc-13fe5e98eda5","year":2025},"citing_paper":{"arxiv_id":"2605.13228","last_updated":"2026-05-13T09:19:22Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:19:22Z","title":"ReTool-Video: Recursive Tool-Using Video Agents with Meta-Augmented Tool Grounding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-14T20:08:13.214803Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2605.13228"},"observation_digest":"sha256:19a6dfdc8c8183e61da3edf55889839d1614ea16caafb0f558f32f17320053ae","observation_id":"9b921024-34a3-4271-9a43-c1d4c8002411","resolution":{"observed_at":"2026-05-14T20:09:26.412402Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":"2506.13654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-07-02T17:27:15.209497Z","title":"Qwen3.5-omni technical report, 2026a","venue":null,"work_id":"530e118a-54d5-4bd0-a0cc-13fe5e98eda5","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:fe1ea6b1a29777c250c97fc6a385b6366635f99bf174b235b8c8f6dd2001ea46","observation_id":"109b9733-637a-465b-a045-29273b932d53","resolution":{"observed_at":"2026-05-20T19:38:56.129604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":"2506.13654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-07-02T17:27:15.209497Z","title":"Qwen3.5-omni technical report, 2026a","venue":null,"work_id":"530e118a-54d5-4bd0-a0cc-13fe5e98eda5","year":2025},"citing_paper":{"arxiv_id":"2605.22907","last_updated":"2026-05-21T18:00:22Z","snapshot_observed_at":"2026-08-12T16:11:30.892862Z","submitted_at":"2026-05-21T18:00:22Z","title":"VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-25T05:51:49.390597Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2605.22907"},"observation_digest":"sha256:49ba0e51e9339a3136e7f0ae01f17a85003c52cd07523cd975477a925742fa36","observation_id":"d03ee091-bbaf-449d-864a-bfac5179e861","resolution":{"observed_at":"2026-05-25T05:55:24.960208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":"2506.13654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-07-02T17:27:15.209497Z","title":"Qwen3.5-omni technical report, 2026a","venue":null,"work_id":"530e118a-54d5-4bd0-a0cc-13fe5e98eda5","year":2025},"citing_paper":{"arxiv_id":"2606.02482","last_updated":"2026-06-29T07:37:14Z","snapshot_observed_at":"2026-08-14T05:01:18.151983Z","submitted_at":"2026-06-01T16:52:11Z","title":"X-Stream: Exploring MLLMs as Multiplexers for Multi-Stream Understanding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T15:06:22.102725Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2606.02482"},"observation_digest":"sha256:dbe2cd1f79451751f452eaf7d3af5e6c918292f8e6c7626eff9e20791ba6a683","observation_id":"0f7b432f-5591-4e87-835a-38cc7a7da685","resolution":{"observed_at":"2026-07-01T22:46:18.952535Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":"2506.13654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-07-02T17:27:15.209497Z","title":"Qwen3.5-omni technical report, 2026a","venue":null,"work_id":"530e118a-54d5-4bd0-a0cc-13fe5e98eda5","year":2025},"citing_paper":{"arxiv_id":"2606.02482","last_updated":"2026-06-29T07:37:14Z","snapshot_observed_at":"2026-08-14T05:01:18.151983Z","submitted_at":"2026-06-01T16:52:11Z","title":"X-Stream: Exploring MLLMs as Multiplexers for Multi-Stream Understanding","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T10:42:37.401221Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2606.02482"},"observation_digest":"sha256:b21e6d706646ee9b960a332ea28447284c39d1d84ddc6eb00de036dd87613a28","observation_id":"c90aeb62-6807-4de8-8d28-c75d9f25beaa","resolution":{"observed_at":"2026-06-30T10:44:36.440259Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":"2506.13654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-07-02T17:27:15.209497Z","title":"Qwen3.5-omni technical report, 2026a","venue":null,"work_id":"530e118a-54d5-4bd0-a0cc-13fe5e98eda5","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":240,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:a858761dcc57adbb3df2ac8f01a5daa22f4b6b8b57d5439ece69aa402fc75cec","observation_id":"5d5e67b7-0380-49e4-98be-e109d7be32a1","resolution":{"observed_at":"2026-07-02T17:27:15.211047Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Ego-r1: Chain-of-tool- thought for ultra-long egocentric video reasoning.arXiv preprint arXiv:2506.13654, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:27cb94f70d2603d7d811bd015d9471fe3d31e509855f1cddc611124333de39ea","observation_id":"b3a46354-b2c7-4b15-b292-0dad84c0b2ac","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-07-14T05:16:32.658643Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11487","last_updated":"2026-07-13T12:40:17Z","snapshot_observed_at":"2026-08-08T11:38:15.879727Z","submitted_at":"2026-07-13T12:40:17Z","title":"LightMem-Ego: Your AI Memory for Everyday Life","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-14T05:16:32.658643Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2607.11487"},"observation_digest":"sha256:930b17ebcd60049912ad3cfbcb08ad350518b43db67a71cd2d20faac071da8c2","observation_id":"7d6ab86a-d0c6-477e-b5d3-a324d5fbe87a","resolution":{"observed_at":"2026-07-14T05:16:32.658643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-08-05T04:44:30.600425Z","title":"arXiv preprint arXiv:2506.13654 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:30.600425Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:e9dc579e2fa168e0275efb66370bd06f3ba5a1897592de0cb516a77bc65501c3","observation_id":"2c336cee-0198-4967-87ef-4c11cc1ca7a0","resolution":{"observed_at":"2026-08-05T04:44:30.600425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-08-10T04:59:13.728483Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07417","last_updated":"2026-08-07T17:02:02Z","snapshot_observed_at":"2026-08-13T15:22:04.491612Z","submitted_at":"2026-08-07T17:02:02Z","title":"I Seek You in Videos: Identity-Conditioned Queries for Person-Centric Video Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T04:59:13.728483Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2608.07417"},"observation_digest":"sha256:00db3e1a9ece70b0429310a51323d3ac9552d96bdc65caf0455c609300b368fd","observation_id":"11bc2765-eb06-48da-a733-6afec116836e","resolution":{"observed_at":"2026-08-10T04:59:13.728483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-08-12T00:43:38.933979Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07959","last_updated":"2026-08-08T06:48:08Z","snapshot_observed_at":"2026-08-13T23:22:26.363793Z","submitted_at":"2026-08-08T06:48:08Z","title":"SCOUT: Self-Checking and Recovery-Aware Tool-Thought Agents for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T00:43:38.933979Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2608.07959"},"observation_digest":"sha256:82cad66bd3b9f8454be3fa6afde4d2ca3d2a5c41fd1632435066ed556d114eca","observation_id":"02489271-0e2e-42dc-8992-fa1596c4545e","resolution":{"observed_at":"2026-08-12T00:43:38.933979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-08-14T04:45:25.443825Z","title":"arXiv preprint arXiv:2506.13654 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11260","last_updated":"2026-08-07T17:07:49Z","snapshot_observed_at":"2026-08-14T09:12:35.251320Z","submitted_at":"2026-08-07T17:07:49Z","title":"Glance, Scrutinize, and Think: Advancing Video Anomaly Detection from Training-Free to Agentic Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T04:45:25.443825Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2608.11260"},"observation_digest":"sha256:e56a698d198f2a140f0f5641505b8c554978620b69d0d8e665acc873833a1cd1","observation_id":"cc4523de-caa2-4f54-8b23-0a74b2488ae4","resolution":{"observed_at":"2026-08-14T04:45:25.443825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.13654/citation-record","integrity":"/paper/2506.13654/integrity","json":"/paper/2506.13654/citation-record.json","paper":"/paper/2506.13654"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T00:34:27.715661Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:27.715661Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:be7cb77757850ee17df5a1f50ae964833bd93ef3ef19823531cdbd40f719ed43","observation_id":"77c1d815-7bbd-4456-a308-069b52de66df","resolution":{"observed_at":"2026-08-07T00:34:27.715661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:27.854755Z","title":"Claude 3.5 sonnet","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:27.854755Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:36eb9ffd45b4ed12028fdc65d125ad1493a55bcac7574a964b20eccddeebcb22","observation_id":"fb2ff0e1-b835-4ba3-90d6-c1c5ebe72dbb","resolution":{"observed_at":"2026-08-07T00:34:27.854755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T00:34:27.934755Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:27.934755Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:361298e622b05c4b5ba72ebc5ea8d209e80adf66abbb62f6822349bfa89db3c4","observation_id":"ec9bbc5d-975a-4081-8c2e-3c9edd79f5fc","resolution":{"observed_at":"2026-08-07T00:34:27.934755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:28.038072Z","title":"Hourvideo: 1-hour video- language understanding.Advances in Neural Information Processing Systems, 37:53168–53197, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:28.038072Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:cd14faf6a81e66ad72bb8fa393e5b48180101071b9beac3034ee1cdf5e858f42","observation_id":"f8097abb-5e8c-4e6b-a2de-e53eb40f8c57","resolution":{"observed_at":"2026-08-07T00:34:28.038072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:28.116311Z","title":"Grounded multi-hop videoqa in long-form egocentric videos, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:28.116311Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:508dff2981585d1630bfa15961d7c778ec76fbc1b8133949726899b7c190a9ad","observation_id":"04155ab7-ec8e-4c92-b802-8000d3153b6a","resolution":{"observed_at":"2026-08-07T00:34:28.116311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:28.228491Z","title":"Egoplan-bench: Benchmarking egocentric embodied planning with multimodal large language models.CoRR, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:28.228491Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:79a98a5256190ee53cd11c7c2bb83f64b1a7313ebe5160fe43a790ceddf73c09","observation_id":"0b910e81-0d1c-4adb-8d5d-e11d9543dcd0","resolution":{"observed_at":"2026-08-07T00:34:28.228491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-07T00:34:28.324818Z","title":"Longvila: Scaling long-context visual language models for long videos.arXiv preprint arXiv:2408.10188, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:28.324818Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:fda37953036daefc10130a71a236c866fdea7c21bcd99316bfecf0b436a4ad47","observation_id":"e82aa700-434c-4361-b9f2-dc66b162c905","resolution":{"observed_at":"2026-08-07T00:34:28.324818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:28.406475Z","title":"Egothink: Evaluating first-person perspective thinking capability of vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:28.406475Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:3a99a8b4f9fa1b83de58ab7a5da957da4b9d1e37ae32843d4a4bb670060413ea","observation_id":"1e5864e8-3152-445c-a021-412e78351f40","resolution":{"observed_at":"2026-08-07T00:34:28.406475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:28.479394Z","title":"Le, Sergey Levine, and Yi Ma","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:28.479394Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:ada9038e7eb911fe8fce7b2cd881baa536ba7d64946bed5ca2c7e377f1d820f9","observation_id":"48277516-df54-46c9-b12a-482e3e8141c2","resolution":{"observed_at":"2026-08-07T00:34:28.479394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:28.631909Z","title":"Scaling egocentric vision: The epic-kitchens dataset","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:28.631909Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:dff5cea686a867821de676655da3088ee9e72fb151647e6f5199249ff36c7377","observation_id":"37974fcf-67f1-4d7f-8a02-581d624ababb","resolution":{"observed_at":"2026-08-07T00:34:28.631909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17352","snapshot_observed_at":"2026-08-07T00:34:28.767290Z","title":"Open- vlthinker: An early exploration to complex vision-language reasoning via iterative self- improvement.arXiv preprint arXiv:2503.17352, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:28.767290Z"},"links":{"cited_paper":"/paper/2503.17352","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:044166d8115c830fbe5abbf44558df39fe7373fcd11abeab53207e2426a6de6d","observation_id":"1bb9fd6f-27f8-44b2-a799-f0dc217a43c1","resolution":{"observed_at":"2026-08-07T00:34:28.767290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:49.017080Z","title":"Grounded question-answering in long egocentric videos","venue":null,"work_id":"45b59348-7fe6-4aed-83fc-9d29d9ff9324","year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:28.835969Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:864bace2bc553b37a341689bfa1cc18c11b7c882f6ab86448f57bba065517137","observation_id":"63a9ee3b-861f-44c4-833e-201481194c0a","resolution":{"observed_at":"2026-08-07T00:34:49.138120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14432","last_updated":"2025-05-02T16:03:31Z","snapshot_observed_at":"2026-08-14T01:28:00.438542Z","submitted_at":"2024-11-21T18:59:55Z","title":"Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14432","snapshot_observed_at":"2026-08-07T00:34:28.953249Z","title":"Insight-v: Exploring long-chain visual reasoning with multimodal large language models.arXiv preprint arXiv:2411.14432, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:28.953249Z"},"links":{"cited_paper":"/paper/2411.14432","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:5cbe3d10f74abb74247708eb2af709d8bf57f293bce9cd5f962a4d6f5402555a","observation_id":"a718607d-b096-44db-8248-2b437ce2e913","resolution":{"observed_at":"2026-08-07T00:34:28.953249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:48.794891Z","title":"Videoagent: A memory-augmented multimodal agent for video understanding","venue":null,"work_id":"6ec08b20-32cf-4736-aaca-df258ac0604b","year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:29.117356Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:4c4db1f1632bc42bb7e338b09e607bb8b5c000010df9044b4891a5f00c66ae93","observation_id":"05a88b46-0edf-441e-be1e-6709e73c4ae3","resolution":{"observed_at":"2026-08-07T00:34:48.840240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11536","snapshot_observed_at":"2026-08-07T00:34:29.268798Z","title":"Retool: Reinforcement learning for strategic tool use in llms.arXiv preprint arXiv:2504.11536, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:29.268798Z"},"links":{"cited_paper":"/paper/2504.11536","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:fb8915c6a557ed502291b2348f2cbbb27efdfadcc8bfb12c6f984cb267c5de87","observation_id":"84ada132-884c-47b6-94cb-8bee98ea965d","resolution":{"observed_at":"2026-08-07T00:34:29.268798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-07T00:34:29.469915Z","title":"Video-r1: Reinforcing video reasoning in mllms.arXiv preprint arXiv:2503.21776, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:29.469915Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:fbbcdbeb652c78c31988d1d60da625b539f609e7a81b36552880910c7e6e9204","observation_id":"056ac988-be6e-4cdf-868d-b6f4df668eda","resolution":{"observed_at":"2026-08-07T00:34:29.469915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:48.652093Z","title":"The equivalence of weighted kappa and the intraclass correlation coefficient as measures of reliability.Educational and psychological measurement, 33(3):613–619, 1973","venue":null,"work_id":"39e4476b-db76-4ee4-bde5-1f206bfa2004","year":1973},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:29.593139Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:165c64733599a79fd86f8e1fdf53eccceb148dd7606772a6b42b2ab056bd7da5","observation_id":"ee829ba0-4dd4-4e21-b5b4-ee8e4e8a1ccd","resolution":{"observed_at":"2026-08-07T00:34:48.683570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T00:34:29.704806Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.arXiv preprint arXiv:2405.21075, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:29.704806Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:6197d312d7475f045deab3844fcf1d4efe5ab356e60491a32c7303005377c765","observation_id":"a280903e-47cb-4ccd-94f3-793f00c266a7","resolution":{"observed_at":"2026-08-07T00:34:29.704806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:48.463429Z","title":"Amego: Active memory from long egocentric videos","venue":null,"work_id":"ec7063f4-0a40-4745-839a-3568440140ff","year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:29.814772Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:61ba7f5a27ff43dd4c650cad2d06611b662d1f20105c3afc45f84a5e1b6a44ad","observation_id":"efee3ed6-83c3-4f14-847e-d2e31233d5de","resolution":{"observed_at":"2026-08-07T00:34:48.507874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:29.984751Z","title":"Gemini 2.5: Our most intelligent ai model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:29.984751Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:1a841e6517586e5f3a55bb6b0c6d30426590206fae95c37469027c4142b528a5","observation_id":"e9195358-fb87-4ebd-8599-7b26bd391a37","resolution":{"observed_at":"2026-08-07T00:34:29.984751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17452","last_updated":"2024-02-21T12:59:22Z","snapshot_observed_at":"2026-08-13T21:12:04.800343Z","submitted_at":"2023-09-29T17:59:38Z","title":"ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17452","snapshot_observed_at":"2026-08-07T00:34:30.095135Z","title":"Tora: A tool-integrated reasoning agent for mathematical problem solving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:30.095135Z"},"links":{"cited_paper":"/paper/2309.17452","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:19301cfa4d883451c2eabb3057bcc00464a5d89710d040a9a77657b74c51484f","observation_id":"f864f294-2cd2-4a2e-aa0e-9c2bd59a2ce7","resolution":{"observed_at":"2026-08-07T00:34:30.095135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:30.170542Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:30.170542Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:74ef80a14ca3542c85e71b40c56e72ca2bbedd3699b5429a32cdf27a08b9af96","observation_id":"e58a8d84-802c-44ed-8dfe-62b7b08ed55d","resolution":{"observed_at":"2026-08-07T00:34:30.170542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:30.323468Z","title":"Ego-exo4d: Understanding skilled human activity from first-and third-person perspectives","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:30.323468Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:3df62d6570dfd365bdcf489c6d982aa348780533d56756b863beed68790542b3","observation_id":"d53dff87-bdbf-4fad-8a7d-b2e660162ca9","resolution":{"observed_at":"2026-08-07T00:34:30.323468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-07T00:34:30.431091Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models.arXiv preprint arXiv:2503.06749, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:30.431091Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:7bcf12b34150ead178a60536f48604103a74e375a8c748ade2fe25e9a27dd773","observation_id":"eb14bfe4-aead-4dd5-9345-b44e27e63e1c","resolution":{"observed_at":"2026-08-07T00:34:30.431091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:48.014334Z","title":"Token-efficient long video understanding for multimodal llms, 2025","venue":null,"work_id":"0c940d57-4abe-4aac-8125-f1de3156fee9","year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:30.665241Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:0b597130c0e6e491c19a228dd98dff0b6fe34da096beb50ed48f1c1dc6219f2e","observation_id":"07905b58-de41-435f-ad73-5b106c5084ce","resolution":{"observed_at":"2026-08-07T00:34:48.184753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-07T00:34:30.764896Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning.arXiv preprint arXiv:2503.09516, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:30.764896Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:3e4e3cbcf97b1e38edfcb8be11fe2164b45ab37cd75030f37e4c2b14c52a3278","observation_id":"e9efc2bf-6aed-4a91-b6fe-7c0e65536a28","resolution":{"observed_at":"2026-08-07T00:34:30.764896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:30.903806Z","title":"Dwim: Towards tool-aware visual rea- soning via discrepancy-aware workflow generation & instruct-masking tuning.arXiv preprint arXiv:2503.19263, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:30.903806Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:e3fb49f0c770e4fa9029454ac393854dad9d56372ef40a82cc6b076113f7f590","observation_id":"08665631-7fcd-4bc9-97e6-df55d69ee054","resolution":{"observed_at":"2026-08-07T00:34:30.903806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T00:34:31.034179Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:31.034179Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:40687c3c36e9930770346f196ead73dae5a4b43e0c617b1d6c69e2c36ddae88b","observation_id":"016c1196-e6bb-415d-b6af-530b941c8c3d","resolution":{"observed_at":"2026-08-07T00:34:31.034179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:31.194830Z","title":"Videochat: Chat-centric video understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:31.194830Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:97925f95dcb47bb3dd526f0ad715a5081b848389462a7198b25b824867fe7db0","observation_id":"c629ab87-098a-4265-8948-64674485df2b","resolution":{"observed_at":"2026-08-07T00:34:31.194830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-11T03:04:58.028847Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T00:34:31.307164Z","title":"Torl: Scaling tool-integrated rl.arXiv preprint arXiv:2503.23383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:31.307164Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:25b933fde871ec8901c5857e0f2b97f94e7f7aa5798e85752a55edcd326f9b91","observation_id":"be98b4be-dba1-44c8-bb83-0f574e20da63","resolution":{"observed_at":"2026-08-07T00:34:31.307164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22152","last_updated":"2025-03-28T05:10:59Z","snapshot_observed_at":"2026-08-07T16:31:01.637325Z","submitted_at":"2025-03-28T05:10:59Z","title":"EgoToM: Benchmarking Theory of Mind Reasoning from Egocentric Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22152","snapshot_observed_at":"2026-08-07T00:34:31.617064Z","title":"Egotom: Benchmarking theory of mind reasoning from egocentric videos.arXiv preprint arXiv:2503.22152, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:31.617064Z"},"links":{"cited_paper":"/paper/2503.22152","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:14b0fc90035daa0bc478ad418cea8f960ecddcde32d5650b770407b0aec65989","observation_id":"3185ca9f-fdfd-4cd8-b3d3-5367744f0b2e","resolution":{"observed_at":"2026-08-07T00:34:31.617064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08190","last_updated":"2024-02-21T20:28:13Z","snapshot_observed_at":"2026-08-13T04:42:13.982761Z","submitted_at":"2024-01-16T08:08:01Z","title":"MARIO: MAth Reasoning with code Interpreter Output -- A Reproducible Pipeline","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08190","snapshot_observed_at":"2026-08-07T00:34:31.944608Z","title":"Mario: Math reasoning with code interpreter output–a reproducible pipeline.arXiv preprint arXiv:2401.08190, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:31.944608Z"},"links":{"cited_paper":"/paper/2401.08190","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:d4e6ea157a37dc5eba79e12b7f42d06e1b394d74faa3d477dcd0b9b480ab7757","observation_id":"e435e1c0-17de-4a56-b516-e273264d7ac2","resolution":{"observed_at":"2026-08-07T00:34:31.944608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00754","last_updated":"2024-11-21T18:52:31Z","snapshot_observed_at":"2026-08-12T23:10:03.149852Z","submitted_at":"2024-08-01T17:57:12Z","title":"Coarse Correspondences Boost Spatial-Temporal Reasoning in Multimodal Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00754","snapshot_observed_at":"2026-08-07T00:34:32.084749Z","title":"Coarse correspondence elicit 3d spacetime understanding in multimodal language model.arXiv preprint arXiv:2408.00754, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:32.084749Z"},"links":{"cited_paper":"/paper/2408.00754","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:64300a83d56b34b4685fbaef298dec7f33a7b9698bba2713ea40e8923a4cf04a","observation_id":"ed1433d7-667b-469a-9390-b35f87b0fbe0","resolution":{"observed_at":"2026-08-07T00:34:32.084749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12961","last_updated":"2025-02-27T06:09:46Z","snapshot_observed_at":"2026-08-12T22:41:32.229292Z","submitted_at":"2024-09-19T17:59:51Z","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12961","snapshot_observed_at":"2026-08-07T00:34:32.189262Z","title":"Oryx mllm: On- demand spatial-temporal understanding at arbitrary resolution.arXiv preprint arXiv:2409.12961, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:32.189262Z"},"links":{"cited_paper":"/paper/2409.12961","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:ab1d6fc8cba8d1f3e3e0fda330c1ff104de97009aaf8be6295d31c7055d86dad","observation_id":"98ea8d80-91eb-45a2-b744-d3f1e36301d0","resolution":{"observed_at":"2026-08-07T00:34:32.189262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12966","last_updated":"2024-03-21T16:26:44Z","snapshot_observed_at":"2026-08-13T00:50:05.558651Z","submitted_at":"2024-03-19T17:59:52Z","title":"Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12966","snapshot_observed_at":"2026-08-07T00:34:32.299228Z","title":"Chain-of-spot: Interactive reasoning improves large vision-language models.arXiv preprint arXiv:2403.12966, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:32.299228Z"},"links":{"cited_paper":"/paper/2403.12966","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:b8430ceca88933d0a08d8d87545bb0324af8a69a048c27646e454bb4c2de10d7","observation_id":"b64d36b5-fdc8-43d7-9c26-6476c5b90630","resolution":{"observed_at":"2026-08-07T00:34:32.299228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-14T09:13:56.327308Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-08-07T00:34:32.454824Z","title":"Ola: Pushing the frontiers of omni-modal language model with progressive modality alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:32.454824Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:f819023cf1dc3d30099e9531197872524263540bd9d7b632e49422add5217b88","observation_id":"6a229ab0-3baa-4764-bed8-d65f74e078af","resolution":{"observed_at":"2026-08-07T00:34:32.454824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:32.624750Z","title":"Video-rag: Visually-aligned retrieval-augmented long video comprehension.arXiv preprint arXiv:2411.13093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:32.624750Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:19ab03de5cbfc31a73957c9a159159ba9a529fa7fe83d3d6b08b824032a6a008","observation_id":"20ea198d-1471-437e-95d9-af28d818f29e","resolution":{"observed_at":"2026-08-07T00:34:32.624750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:47.713084Z","title":"Taco: Learning multi-modal action models with synthetic chains-of-thought-and-action, 2024","venue":null,"work_id":"5e8882e8-4f9e-4c42-a112-75f9a8e93eaa","year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:32.784761Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:a1004e51e54ab33357311085c76be2703d346885d80c9ebebc8c418fc73e570b","observation_id":"0294306e-54cb-4eb9-bb50-e731bdc16648","resolution":{"observed_at":"2026-08-07T00:34:47.887292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:47.292060Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models, 2024","venue":null,"work_id":"d615c779-ae37-4a31-8f4c-d94a7692c02d","year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:32.884917Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:7d00d09a4e10c904445d0b20e5a1bfc6956bab5235ed55a26d5407f0e97fb9c1","observation_id":"d50bc019-234a-4f69-8934-83d8e9e137b2","resolution":{"observed_at":"2026-08-07T00:34:47.552435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:32.974861Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding.Advances in Neural Information Processing Systems, 36:46212–46244, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:32.974861Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:a6f29bcb34847c0899b52f37207c205ca28ebca23b35a920699c7eafdf2f1eb1","observation_id":"a3bd5bb5-9a28-4015-84ca-b80cf9816fed","resolution":{"observed_at":"2026-08-07T00:34:32.974861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:33.174757Z","title":"Hello gpt-4o, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:33.174757Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:598171d180740020daa4f3b7961325a0335eea1e59a25721c98c40fa6dd7f1af","observation_id":"f4daed76-de73-4fba-99d2-6b20fada6f4a","resolution":{"observed_at":"2026-08-07T00:34:33.174757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:33.282474Z","title":"Introducing gpt-4.1 in the api, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:33.282474Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:bd6dbe315a4467bcc636b716a17dcd0425f0692725b98dcb9267be795597c8e4","observation_id":"d4f0092c-7af2-4866-aa21-fc927993833c","resolution":{"observed_at":"2026-08-07T00:34:33.282474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:33.376167Z","title":"Openai o3 and o4-mini system card, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:33.376167Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:f3b5039faae7705cb2489359983fd182a8731dd38ddc93030dc22437bec24869","observation_id":"02234b0c-54bf-4d1f-b1c2-17aaa52408e9","resolution":{"observed_at":"2026-08-07T00:34:33.376167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12255","last_updated":"2022-05-24T17:58:13Z","snapshot_observed_at":"2026-08-13T15:37:51.220695Z","submitted_at":"2022-05-24T17:58:13Z","title":"TALM: Tool Augmented Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12255","snapshot_observed_at":"2026-08-07T00:34:33.555377Z","title":"Talm: Tool augmented language models.arXiv preprint arXiv:2205.12255, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:33.555377Z"},"links":{"cited_paper":"/paper/2205.12255","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:d759f68c6d85bc704af91f81d3113c59004e7dc9459d0209b88ffbccb3bbb884","observation_id":"682ef09d-1204-4ced-b32a-c2d0d4b805bf","resolution":{"observed_at":"2026-08-07T00:34:33.555377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04144","snapshot_observed_at":"2026-08-07T00:34:33.661243Z","title":"Hd-epic: A highly-detailed egocentric video dataset.arXiv preprint arXiv:2502.04144, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:33.661243Z"},"links":{"cited_paper":"/paper/2502.04144","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:ffcbc91712fd18cc3aa9466f8f3f359b6e0e09c7709e13d350f346e9bf3f3172","observation_id":"7c640ee3-a711-4b62-a391-8a8c515ba6f7","resolution":{"observed_at":"2026-08-07T00:34:33.661243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-08-13T15:50:50.317321Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-08-07T00:34:33.755199Z","title":"Toolrl: Reward is all tool learning needs.arXiv preprint arXiv:2504.13958, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:33.755199Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:c1db5aa7b540d8beb43a4a1efa2f4753d70b4345e665cfdc01951535e6f4b6b7","observation_id":"2faef582-a453-4cc7-9aea-2afeffe60fa8","resolution":{"observed_at":"2026-08-07T00:34:33.755199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16789","last_updated":"2023-10-03T14:45:48Z","snapshot_observed_at":"2026-07-06T16:00:46.542753Z","submitted_at":"2023-07-31T15:56:53Z","title":"ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16789","snapshot_observed_at":"2026-08-07T00:34:33.845268Z","title":"Toolllm: Facilitating large language models to master 16000+ real-world apis.arXiv preprint arXiv:2307.16789, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:33.845268Z"},"links":{"cited_paper":"/paper/2307.16789","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:ae5827dd1582f437b734559455953fcd0f7efa3091f1fea4a8a3a2b6a1f80a09","observation_id":"8ca254fd-421f-492f-8ebb-8a906aa7b788","resolution":{"observed_at":"2026-08-07T00:34:33.845268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:46.734747Z","title":"Does your vision-language model get lost in the long video sampling dilemma?, 2025","venue":null,"work_id":"72a1ecd0-b813-4d5e-89bd-81f1c7729a51","year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:33.944845Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:ba3727d20c1cd10357e953533b5f8a6fe670a9cc733876a7d5b8f9dfc687d557","observation_id":"ca93dab1-70b7-4cb6-98ec-8236c5b4fd98","resolution":{"observed_at":"2026-08-07T00:34:46.930358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:46.395623Z","title":"Action scene graphs for long-form understanding of egocentric videos","venue":null,"work_id":"c33c68f3-6d7f-462b-8e43-b3695ac0bfda","year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:34.034827Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:55b0a3de20761774530596bebd7ad2eabdf0395d0070206ca1b141c75c7be10a","observation_id":"bfa7678d-da38-4f4a-91d2-65d77ef1e83d","resolution":{"observed_at":"2026-08-07T00:34:46.496211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:46.128729Z","title":"Toolformer: Language models can teach themselves to use tools.Advances in Neural Information Processing Systems, 36:68539– 68551, 2023","venue":null,"work_id":"ac11e55e-208d-4d0d-b80c-3d94eafc30e9","year":2023},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:34.145870Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:efb019bb80d15464513b71df7787316ce377467c50e73313d30b17bf80af1e7b","observation_id":"42e2d3ce-dc0a-4e83-aece-cb79bc4834ad","resolution":{"observed_at":"2026-08-07T00:34:46.227231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T00:34:34.295555Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:34.295555Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:b851b086885ae85de73f28a5976b0a6394b3668ddb3fb6af12e2ded190d0a2f8","observation_id":"d3e0efdd-9c31-4ba4-977e-6f5b56a44954","resolution":{"observed_at":"2026-08-07T00:34:34.295555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:34.522339Z","title":"Kim, Bilge Soran, Raghuraman Krishnamoorthi, Mohamed Elhoseiny, and Vikas Chandra","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:34.522339Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:ef6e6a65d261337f710a6402512276a1cf16d4ffe616ea006dc2dab2e8b257a4","observation_id":"af796e8e-0e42-4619-a00b-d47a6e9c0d34","resolution":{"observed_at":"2026-08-07T00:34:34.522339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:45.767605Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding, 2024","venue":null,"work_id":"6f9c57fa-371e-4503-9ec8-7fa0a0c5aeb9","year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:34.651708Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:27bcd2e79594a8a9f1c81f50f9595cb75895e0ddf350e0444bd1aac24f54464b","observation_id":"801deda3-d498-4980-8b95-b9ddb2588e39","resolution":{"observed_at":"2026-08-07T00:34:45.864825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:45.343793Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":"cae3b5aa-bfaf-4f84-8079-f682ce6ad188","year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:34.778221Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:7d6bd4abbea18f5a4a7c7e9d8ae3dabb2dd90fd9fa66a1f160e7e11fcac69a03","observation_id":"927d623b-5136-49a0-9169-9f941d2b0ab7","resolution":{"observed_at":"2026-08-07T00:34:45.577610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:45.094798Z","title":"Ego4d goal-step: Toward hierarchical understanding of procedural activities.Advances in Neural Information Processing Systems, 36:38863–38886, 2023","venue":null,"work_id":"0524a6e0-1e14-468b-b430-52ab6c512d60","year":2023},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:34.985585Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:b9c13d6dbc3f5a4f991a04dd64f1eef2e0fa10e75d14710d3b39abed6ebf706d","observation_id":"538b414f-b625-4a72-9922-df5956c5d97c","resolution":{"observed_at":"2026-08-07T00:34:45.235132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:44.784817Z","title":"Openthinkimg: Learning to think with images via visual tool reinforcement learning, 2025","venue":null,"work_id":"10022e6d-c76d-4c2a-91a0-1672ef62cae2","year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:35.114748Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:887b1ed31258732b83b4f8a78f23b9084146363c53945da788d30738fa3de6c5","observation_id":"fee4ebd7-a425-485a-8833-8add7c4bf034","resolution":{"observed_at":"2026-08-07T00:34:44.957037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:44.412727Z","title":"Egotracks: A long-term egocentric visual object tracking dataset.Advances in Neural Information Processing Systems, 36:75716–75739, 2023","venue":null,"work_id":"bb8af7ac-c62f-4f1a-96f1-c9bd5699e998","year":2023},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:35.235816Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:5ed23f1b6bee91ed79eb6bf95c0a3de14d74130293dc22409fe5f474f1484bbb","observation_id":"3dc1e182-de8f-47fa-8b49-4a158309394e","resolution":{"observed_at":"2026-08-07T00:34:44.564617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T00:34:35.334942Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:35.334942Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:b00b23807e7815717895ea5b18c392209bc450798464140e84ef6eee4e289b01","observation_id":"d583ca93-973d-4c47-9a5e-7ea95bf9be32","resolution":{"observed_at":"2026-08-07T00:34:35.334942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06186","last_updated":"2025-01-10T18:59:51Z","snapshot_observed_at":"2026-08-10T21:03:22.633699Z","submitted_at":"2025-01-10T18:59:51Z","title":"LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06186","snapshot_observed_at":"2026-08-07T00:34:35.434855Z","title":"Llamav-o1: Rethinking step-by-step visual reasoning in llms.arXiv preprint arXiv:2501.06186, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:35.434855Z"},"links":{"cited_paper":"/paper/2501.06186","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:70995a4f6c1207d1be62eec2bd5f2955c5b971f330015077905f849be0df86f4","observation_id":"403ae0c8-4d4a-4692-be7f-3b812a64bed0","resolution":{"observed_at":"2026-08-07T00:34:35.434855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14870","last_updated":"2025-05-31T20:08:42Z","snapshot_observed_at":"2026-08-11T08:21:22.753656Z","submitted_at":"2025-04-21T05:40:05Z","title":"Acting Less is Reasoning More! Teaching Model to Act Efficiently","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14870","snapshot_observed_at":"2026-08-07T00:34:35.524752Z","title":"Otc: Optimal tool calls via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:35.524752Z"},"links":{"cited_paper":"/paper/2504.14870","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:8bb2a6563483e3f1aa3b646c9ad221eed4249dc58acbc6932f3e5c1bfc2846b4","observation_id":"71e6db71-59c1-4988-b623-b51841b9e338","resolution":{"observed_at":"2026-08-07T00:34:35.524752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03731","last_updated":"2023-10-05T17:52:09Z","snapshot_observed_at":"2026-08-13T05:55:59.432178Z","submitted_at":"2023-10-05T17:52:09Z","title":"MathCoder: Seamless Code Integration in LLMs for Enhanced Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03731","snapshot_observed_at":"2026-08-07T00:34:35.704789Z","title":"Mathcoder: Seamless code integration in llms for enhanced mathematical reasoning.arXiv preprint arXiv:2310.03731, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:35.704789Z"},"links":{"cited_paper":"/paper/2310.03731","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:deb15b25c2c88b26498b0b6c816973e8f16ae4d7bce1b80983ffff9c9a39a958","observation_id":"5c171505-cd23-422d-9e0a-4bcda81e82f7","resolution":{"observed_at":"2026-08-07T00:34:35.704789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-07T15:56:47.824864Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02867","snapshot_observed_at":"2026-08-07T00:34:35.817428Z","title":"Resanything: Attribute prompting for arbitrary referring segmen- tation.arXiv preprint arXiv:2505.02867, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:35.817428Z"},"links":{"cited_paper":"/paper/2505.02867","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:b34091f5a99f6975c454e5d4744d964fa9cd061850c8f2582077bc4d967bd176","observation_id":"02ca7b66-8a4a-412c-a107-88844dd75ccc","resolution":{"observed_at":"2026-08-07T00:34:35.817428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:35.924786Z","title":"Videoagent: Long-form video understanding with large language model as agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:35.924786Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:72d51a7bfa80504edda2decdf8b0a0ac364c108f75e4f012b3518a026fed1dc5","observation_id":"eed1c324-086e-462a-892f-bdf86347d5f7","resolution":{"observed_at":"2026-08-07T00:34:35.924786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-07T00:34:36.092629Z","title":"Internvideo2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:36.092629Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:a4f9c7f4a9422f6cfe7ae94fbe0fcdd55af8a273709a4fad19bcc8a33cef77b2","observation_id":"bdd91320-29dd-4a1d-9682-0486a7bc0404","resolution":{"observed_at":"2026-08-07T00:34:36.092629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05269","last_updated":"2024-11-05T22:08:14Z","snapshot_observed_at":"2026-08-13T05:07:39.689879Z","submitted_at":"2023-12-07T19:19:25Z","title":"LifelongMemory: Leveraging LLMs for Answering Queries in Long-form Egocentric Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05269","snapshot_observed_at":"2026-08-07T00:34:36.222356Z","title":"Lifelongmemory: Leveraging llms for answering queries in long-form egocentric videos.arXiv preprint arXiv:2312.05269, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:36.222356Z"},"links":{"cited_paper":"/paper/2312.05269","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:a8c906fe5da5b0b1fdb3361cf786f186d44275edc8b24c58fcf516cb7b973f2c","observation_id":"09e77375-5a56-42d8-abc5-9c5285e27993","resolution":{"observed_at":"2026-08-07T00:34:36.222356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19209","last_updated":"2025-03-14T13:57:16Z","snapshot_observed_at":"2026-08-13T21:52:29.854534Z","submitted_at":"2024-05-29T15:49:09Z","title":"VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19209","snapshot_observed_at":"2026-08-07T00:34:36.343155Z","title":"Videotree: Adaptive tree-based video representation for llm reasoning on long videos.arXiv preprint arXiv:2405.19209, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:36.343155Z"},"links":{"cited_paper":"/paper/2405.19209","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:defead88423e8764157b29cdf5c8f3314ae34e08f8c8539e479d381d646c0e58","observation_id":"fd24e478-93f4-46ad-87fa-1ca87619db4e","resolution":{"observed_at":"2026-08-07T00:34:36.343155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:36.414746Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:36.414746Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:85050f42e540cf2307bf317f12dfa82200adbad60174fbd899495260b00955de","observation_id":"902f15dd-bdd0-4330-b8eb-f081805dc878","resolution":{"observed_at":"2026-08-07T00:34:36.414746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:44.167089Z","title":"Longvlm: Efficient long video understanding via large language models, 2024","venue":null,"work_id":"ee680a96-0adc-414b-963f-e21bdc7ce886","year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:36.564826Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:d1cfa944bd4dd84720dfa41b5b144e67245548109b7019aa309eadc064a28565","observation_id":"c05ca396-a014-45a9-8047-8f4f24c7c12d","resolution":{"observed_at":"2026-08-07T00:34:44.265636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:36.694838Z","title":"Autogen: Enabling next-gen llm applications via multi-agent conversation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:36.694838Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:0b54818e6c130901fc6cf390e9194b90558eed10c6082fbda21bf5c5ac825dbd","observation_id":"6bff34e6-1b41-4f46-b402-c6ace4595e26","resolution":{"observed_at":"2026-08-07T00:34:36.694838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12799","last_updated":"2025-03-24T11:30:58Z","snapshot_observed_at":"2026-08-12T01:00:02.203358Z","submitted_at":"2025-03-17T04:07:47Z","title":"Grounded Chain-of-Thought for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12799","snapshot_observed_at":"2026-08-07T00:34:36.765233Z","title":"Grounded chain-of-thought for multimodal large language models.arXiv preprint arXiv:2503.12799, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:36.765233Z"},"links":{"cited_paper":"/paper/2503.12799","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:426777c242817a31d964741882d97edc781ff79a1512c473b6bc37af03f429b4","observation_id":"2ea0c3d6-bc3a-43b0-b421-951261aefd76","resolution":{"observed_at":"2026-08-07T00:34:36.765233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-07T00:34:36.884832Z","title":"Llava-o1: Let vision language models reason step-by-step.arXiv preprint arXiv:2411.10440, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:36.884832Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:91a6e3ac0deb31b49e7abd321bae176f9e023f01243c4620afc1b4411a0c3802","observation_id":"8600a680-4d36-4d28-8a71-8786249cd788","resolution":{"observed_at":"2026-08-07T00:34:36.884832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:43.744744Z","title":"Retrieval-augmented egocentric video captioning","venue":null,"work_id":"aa0032be-b2f7-40a4-8056-a832cff17f6c","year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:37.035116Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:60ddc1aa408a1498d24c0ba78e74789a22a3d70004a116f2e4d9568f428cc646","observation_id":"892e91a0-7c7f-4878-b4f5-9ea2bdb9b8db","resolution":{"observed_at":"2026-08-07T00:34:43.854826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-08-13T17:31:32.138475Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-07T00:34:37.189771Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:37.189771Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:adc78d2c4da0e36c9d1219984f2ba36d5915bbcafab60e2b87fef2bbda0d31ba","observation_id":"803ca2df-9a02-4814-a5d3-d1c1baf9d34a","resolution":{"observed_at":"2026-08-07T00:34:37.189771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:43.399120Z","title":"Octopus: Embodied vision-language programmer from environmental feedback","venue":null,"work_id":"34b3244b-fb99-4a85-b477-2eb84db4fe25","year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:37.307201Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:ae398d64482e1abd5cdd974e3d64fb12e66ec8b58456b5641a2e29419092a39b","observation_id":"7af531b5-b3fa-4528-9329-0cfeaabc85ee","resolution":{"observed_at":"2026-08-07T00:34:43.493927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:43.148431Z","title":"Egolife: Towards egocentric life assistant, 2025","venue":null,"work_id":"fa786916-6afe-4199-af25-f39e2d01d915","year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:37.455810Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:3778e45898abd0353a525ed78eb0a3af48e15ac692f1d75e8fce55dac969b758","observation_id":"d3db0406-64cf-4c97-9059-28ae7b940012","resolution":{"observed_at":"2026-08-07T00:34:43.248598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-07T12:50:27.666060Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-07T00:34:37.634819Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization.arXiv preprint arXiv:2503.10615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:37.634819Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:83cfa46898ded86dc1e75975c4fc342552b61bc089c40f989bd135ccb77be3bb","observation_id":"bf5636e5-baec-4cb4-8ef0-755930318bce","resolution":{"observed_at":"2026-08-07T00:34:37.634819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.03238","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:40.303498Z","title":"Fans–formal answer selection for natural language math reasoning using lean4.arXiv preprint arXiv:2503.03238, 2025","venue":null,"work_id":"688f2a2b-2e9e-4aaa-a2ac-826d5b7eb02e","year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:37.810673Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:76f917c52227ea6ebcdd2c33164b5253a74bb16bfe21617bf991802f5125492d","observation_id":"5bd27a12-b017-4fca-8fcc-d97733421f84","resolution":{"observed_at":"2026-08-07T00:34:40.475550Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:37.907343Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:37.907343Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:4f193a21bbb0db2c7114ff3cdca9a9fdf31ae865584118a86b3102e48ede4cf2","observation_id":"b651686e-0d6f-408a-ad0e-9c8cca9a66d4","resolution":{"observed_at":"2026-08-07T00:34:37.907343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:42.797872Z","title":"Re-thinking temporal search for long-form video understanding, 2025","venue":null,"work_id":"037087ca-c01c-47d7-9ef4-97ac12463280","year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:38.184402Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:2167d5e98a50ded9c20116640f3bb45abb0ad6a2580154ba0952f8eed94dd21f","observation_id":"e3a801b6-ffdd-4b5f-8250-8ba633dfbdb1","resolution":{"observed_at":"2026-08-07T00:34:42.894034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-13T01:30:54.104133Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-07T00:34:38.344923Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization.arXiv preprint arXiv:2503.12937, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:38.344923Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:6f72b251164015039c13e6323103104408d14478898e7885c9a28af1f423fde1","observation_id":"19945513-2a41-4fdd-aee4-746b50179f0a","resolution":{"observed_at":"2026-08-07T00:34:38.344923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T00:34:38.476955Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:38.476955Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:d22b5fb00ccd5f2438492b009b5b6341211192db894c64162cfab4b33909b122","observation_id":"d807b7f7-e6c9-475d-93ee-a9cd1cf256d3","resolution":{"observed_at":"2026-08-07T00:34:38.476955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:38.854867Z","title":"Llava-next: A strong zero-shot video understanding model, April 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:38.854867Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:9e63bb71ba99b5265f89babebc9c0b0b696fae6dc273e4a77147e79a42e3ddb8","observation_id":"6a5704f4-5d7c-4a26-88f5-f0bc04d41b62","resolution":{"observed_at":"2026-08-07T00:34:38.854867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03160","last_updated":"2025-04-17T04:46:08Z","snapshot_observed_at":"2026-08-13T07:33:28.197077Z","submitted_at":"2025-04-04T04:41:28Z","title":"DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03160","snapshot_observed_at":"2026-08-07T00:34:38.995006Z","title":"Deepresearcher: Scaling deep research via reinforcement learning in real-world environments.arXiv preprint arXiv:2504.03160, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:38.995006Z"},"links":{"cited_paper":"/paper/2504.03160","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:d7df7b4e503658e6a648994e3c40b7a3cbceb2a75662b5a093e9617df64af9ea","observation_id":"bcd6bd6b-e740-4f15-8423-b6b03dccf5de","resolution":{"observed_at":"2026-08-07T00:34:38.995006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:42.474054Z","title":"Videoagent2: Enhancing the llm-based agent system for long-form video understanding by uncertainty-aware cot, 2025","venue":null,"work_id":"99ab4d8d-3687-47a1-853b-6660aa8e8818","year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:39.161275Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:7866d8d4128bc90754bd463335066c57e118fe6feb4bb8383d6f0d1ac3fce97c","observation_id":"f0ed8dc1-b5e8-40de-8926-ee09a359e1be","resolution":{"observed_at":"2026-08-07T00:34:42.583883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07921","last_updated":"2023-08-15T17:58:45Z","snapshot_observed_at":"2026-08-13T10:34:06.970583Z","submitted_at":"2023-08-15T17:58:45Z","title":"Solving Challenging Math Word Problems Using GPT-4 Code Interpreter with Code-based Self-Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07921","snapshot_observed_at":"2026-08-07T00:34:39.345662Z","title":"day”levelbackwardfromDAY3_16391802,usingthekeyword“supermarket","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:39.345662Z"},"links":{"cited_paper":"/paper/2308.07921","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:75c59139a73de09b8a25856e9ce25333dda87e7562cd1914da70c398e82bf0fa","observation_id":"75d6ff91-e960-4f8e-af03-926e0ab8e6dc","resolution":{"observed_at":"2026-08-07T00:34:39.345662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:42.254690Z","title":"name \" :","venue":null,"work_id":"a78afe5b-0ffb-4b92-ab86-1cb321a0be9a","year":null},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:39.654749Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:964d2b9b64cc2cefbc5738044d3e5aef25d55744692e10b4ee7c87537330a71e","observation_id":"1b93aa26-4d71-4a60-90a5-65d3013b49de","resolution":{"observed_at":"2026-08-07T00:34:42.366546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":63,"verified_exact":1,"verified_fuzzy":22},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 20 inbound Pith citation observations for arXiv:2506.13654."}