{"as_of":"2026-08-09T06:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:821a19ca6272a33f130d2990050fa0061dddf4f30c92bfa36b1e66342fb39332","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:14:29.581142Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T05:50:27.250841Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T10:41:29.637290Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03097","snapshot_observed_at":"2026-08-03T20:52:51.049418Z","title":"Egovlm: Policy optimization for egocentric video understand- ing.arXiv preprint arXiv:2506.03097, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-07T23:32:07.863489Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:51.049418Z"},"links":{"cited_paper":"/paper/2506.03097","citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:04dea14a19fc37118678107e2958a8aefd3412a114c8cd6003d5b393860184ab","observation_id":"358e3010-f86b-4f49-a0c8-0dcd3bb9fe7c","resolution":{"observed_at":"2026-08-03T20:52:51.049418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03097","snapshot_observed_at":"2026-08-04T05:50:27.250841Z","title":"arXiv preprint arXiv:2506.03097 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.12147","last_updated":"2026-08-03T09:43:55Z","snapshot_observed_at":"2026-08-08T20:08:07.326425Z","submitted_at":"2026-03-12T16:46:01Z","title":"EgoIntent: A Pre-Outcome Micro-Step Benchmark for Understanding What, Why, and Next","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T05:50:27.250841Z"},"links":{"cited_paper":"/paper/2506.03097","citing_paper":"/paper/2603.12147"},"observation_digest":"sha256:213fc07518a32f7fadefffa98d06b12865e1d384e7f31f24083b323b28d53e3f","observation_id":"db8a76be-cd62-4481-9ca2-4f1014065a3b","resolution":{"observed_at":"2026-08-04T05:50:27.250841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"cited_work":{"arxiv_id":"2506.03097","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03097","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems30","venue":null,"work_id":"5fe9ebd5-087d-4888-8d04-569bc746d011","year":2017},"citing_paper":{"arxiv_id":"2604.27621","last_updated":"2026-04-30T09:11:25Z","snapshot_observed_at":"2026-08-03T01:43:27.294399Z","submitted_at":"2026-04-30T09:11:25Z","title":"Robot Learning from Human Videos: A Survey","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-07T04:55:44.273643Z"},"links":{"cited_paper":"/paper/2506.03097","citing_paper":"/paper/2604.27621"},"observation_digest":"sha256:1a42d459c08db49f4d93b3572eb93788ced63f9008a7f1683496849349d5f66f","observation_id":"1fdb557d-46fb-422e-b3b0-ef98a0901133","resolution":{"observed_at":"2026-05-12T10:41:29.640044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"cited_work":{"arxiv_id":"2506.03097","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03097","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems30","venue":null,"work_id":"5fe9ebd5-087d-4888-8d04-569bc746d011","year":2017},"citing_paper":{"arxiv_id":"2605.04227","last_updated":"2026-08-01T20:12:35Z","snapshot_observed_at":"2026-08-06T23:24:38.697717Z","submitted_at":"2026-05-05T19:12:11Z","title":"Pro$^2$Assist: Continuous Step-aware Proactive Assistance with Multi-modal Egocentric Perception for Long-horizon Procedural Tasks","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-08T17:16:31.820718Z"},"links":{"cited_paper":"/paper/2506.03097","citing_paper":"/paper/2605.04227"},"observation_digest":"sha256:112122797469c559b8e633d3ba727a7427c201f0f57d4e1c62029d45dce2c424","observation_id":"6dbe324b-7bf7-4845-adb5-069be76a7df9","resolution":{"observed_at":"2026-05-11T17:46:06.581439Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03097","snapshot_observed_at":"2026-08-04T05:19:56.255880Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.04227","last_updated":"2026-08-01T20:12:35Z","snapshot_observed_at":"2026-08-06T23:24:38.697717Z","submitted_at":"2026-05-05T19:12:11Z","title":"Pro$^2$Assist: Continuous Step-aware Proactive Assistance with Multi-modal Egocentric Perception for Long-horizon Procedural Tasks","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T05:19:56.255880Z"},"links":{"cited_paper":"/paper/2506.03097","citing_paper":"/paper/2605.04227"},"observation_digest":"sha256:a5d5ff8f63b76120a64cc95f3a2826a84a779c94a67b8985e2b5916a4f289444","observation_id":"2ed5ebf4-0079-4353-a6bd-f0edb17c0757","resolution":{"observed_at":"2026-08-04T05:19:56.255880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03097/citation-record","integrity":"/paper/2506.03097/integrity","json":"/paper/2506.03097/citation-record.json","paper":"/paper/2506.03097"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:31.837133Z","title":null,"venue":null,"work_id":"0a1bc643-5bae-46fa-a26f-065b010b0bf9","year":2023},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:26.484755Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:dc011ffe7bac06753e006cb22da072721c3807ca308c48516f2565d51eadeac5","observation_id":"9cf0adb5-e990-427e-b9ba-fcc2aabeae8c","resolution":{"observed_at":"2026-08-07T11:14:31.912954Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T11:14:26.585399Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:26.585399Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:5c352789a5aa077f5860f6dc8feb0d77c648e8ff127a4756d3104c00c0058f61","observation_id":"7c62262a-f97b-4a42-a49e-e7c8c4d7f46d","resolution":{"observed_at":"2026-08-07T11:14:26.585399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-07T11:14:26.665985Z","title":"Back to basics: Revisiting reinforce style op- timization for learning from human feedback in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:26.665985Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:2adfd01bf39e22167344a9fd461f6ed1ba99d0136d69bd7205aefeae66b08d6d","observation_id":"268c3634-4b6b-4f1d-8dc7-fdbe3453239c","resolution":{"observed_at":"2026-08-07T11:14:26.665985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:26.747337Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:26.747337Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:bf1742d0136cc8188040bfffedaf974614e6e38c5ef27e78b2fe5f5dee9fbf9d","observation_id":"6e54bb2d-fa9d-4c34-aa24-d369516496b3","resolution":{"observed_at":"2026-08-07T11:14:26.747337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06722","last_updated":"2024-06-11T06:53:44Z","snapshot_observed_at":"2026-08-09T01:06:11.036691Z","submitted_at":"2023-12-11T03:35:58Z","title":"EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06722","snapshot_observed_at":"2026-08-07T11:14:26.803299Z","title":"Egoplan- bench: Benchmarking multimodal large language models for human-level planning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:26.803299Z"},"links":{"cited_paper":"/paper/2312.06722","citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:8a34325ccf21b4a65c828d50217cd7a8c7f3935dc8cf491e16457289ac6356cf","observation_id":"829fa18c-862f-4e6b-8a1a-caaeada02d0f","resolution":{"observed_at":"2026-08-07T11:14:26.803299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11623","last_updated":"2024-10-15T14:08:53Z","snapshot_observed_at":"2026-07-06T19:33:52.737083Z","submitted_at":"2024-10-15T14:08:53Z","title":"VidEgoThink: Assessing Egocentric Video Understanding Capabilities for Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11623","snapshot_observed_at":"2026-08-07T11:14:26.902583Z","title":"Vide- gothink: Assessing egocentric video understanding capabili- ties for embodied ai.arXiv preprint arXiv:2410.11623, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:26.902583Z"},"links":{"cited_paper":"/paper/2410.11623","citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:2e852ecb3c116bbdceec159ecc292856cf7cf54b28e678bc2e578b5c6776428d","observation_id":"466cd78f-6508-472d-b095-c69c619c2e8e","resolution":{"observed_at":"2026-08-07T11:14:26.902583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:31.722427Z","title":null,"venue":null,"work_id":"38fb642b-aeb6-4576-a5de-67bcf330c352","year":2025},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:26.966208Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:9ab38ecd10dc9e7b051e63526ea06a8770af88d8675466a04be6e9f3739e004a","observation_id":"6531419f-4afd-4eed-8a25-94de004f008c","resolution":{"observed_at":"2026-08-07T11:14:31.779038Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-07T13:56:34.167869Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-07T11:14:27.043868Z","title":"Chatglm: A family of large language models from glm-130b to glm-4 all tools","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:27.043868Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:a152dc222f720304943a9e7dd7b7c46b5b84767e43c1024a310b18688409d0b0","observation_id":"7281fecc-e61b-40e9-aba9-dc314e630fbf","resolution":{"observed_at":"2026-08-07T11:14:27.043868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T11:14:27.136926Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:27.136926Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:ae4ca7096101899a48e58fd5a6da8dafc3b23b67717a5b30504cfa992e790af0","observation_id":"fd5018df-37a8-459b-bd86-54df58edf779","resolution":{"observed_at":"2026-08-07T11:14:27.136926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:31.599923Z","title":"Mvbench: A comprehensive multi- modal video understanding benchmark, 2024","venue":null,"work_id":"9713188c-018f-4127-8ed5-5490e76a9e14","year":2024},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:27.251656Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:8fceecd4665f93c13159584ac61533a7001b0457fa01643d3af07db3bb98677a","observation_id":"8e1f2ebc-5652-4ef5-9a09-f499df2d6a3d","resolution":{"observed_at":"2026-08-07T11:14:31.650068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07856","last_updated":"2026-07-09T13:57:40Z","snapshot_observed_at":"2026-08-07T16:06:48.703650Z","submitted_at":"2025-04-10T15:32:00Z","title":"Dual-Difficulty Curriculum Learning for Direct Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07856","snapshot_observed_at":"2026-08-07T11:14:27.351094Z","title":"2d-curri-dpo: Two- dimensional curriculum learning for direct preference opti- mization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:27.351094Z"},"links":{"cited_paper":"/paper/2504.07856","citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:56cbe536706b8c1193eba40f365fbd3dba940c0c66a78c6cfbfbffddf754ccb3","observation_id":"9d089f33-2fa1-42a4-b067-705125e34387","resolution":{"observed_at":"2026-08-07T11:14:27.351094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:31.483415Z","title":"ROUGE: A package for automatic evaluation of summaries","venue":null,"work_id":"de2f5ce9-c23b-4938-a329-a4c36d599630","year":2004},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:27.482076Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:194a34abe5630ca35be03ebca92489513b2b22ad21fe81deb9afdc7d5df2e5dc","observation_id":"94afe2fa-f34c-4ffc-9b8f-dce191566858","resolution":{"observed_at":"2026-08-07T11:14:31.558170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:27.604637Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:27.604637Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:eb52eb1a391928f8a711ee995551b63f471b4cb9fa5910fba02c4897ac6b45a5","observation_id":"3094ddd2-5790-45dc-8488-ba0939c6f1c1","resolution":{"observed_at":"2026-08-07T11:14:27.604637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-07T11:14:27.701631Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:27.701631Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:3bed043b7bca3fa950e4e00dbec0fa017d66b6863f526221925e2cd9a5689622","observation_id":"1f733e8e-e71c-4a73-b8e3-a4d59c859591","resolution":{"observed_at":"2026-08-07T11:14:27.701631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T11:14:27.794624Z","title":"Visual- rft: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:27.794624Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:bc7e1bb4ee5189094c74ad19b74fcffd7f764fb3e776ab5213ed584d5be53bfa","observation_id":"52c4be18-2d30-49e9-ba1d-c1880b371685","resolution":{"observed_at":"2026-08-07T11:14:27.794624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:31.370116Z","title":"Reasoning models can be effective without thinking, 2025","venue":null,"work_id":"2b73119f-c7cb-4e5b-827f-e44fdffebb80","year":2025},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:27.897137Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:c642d17776d3f7feb942d7f3519efed4f5f6bf1837b2f203eedafcd238e8b918","observation_id":"32e78173-37f0-4384-9aa4-b0f083b520eb","resolution":{"observed_at":"2026-08-07T11:14:31.418970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:31.250030Z","title":"Egoschema: A diagnostic benchmark for very long- form video language understanding","venue":null,"work_id":"7dda0793-29ed-430b-8bcc-b86bc0e75f5e","year":2023},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:27.989782Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:a1af87e9b833b40b43f7a06479ba5b28973da4783af2c436883dfcdfe627bb97","observation_id":"a91b1c91-5fe9-4fc6-8fb2-4495f31efc8e","resolution":{"observed_at":"2026-08-07T11:14:31.299087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:28.107807Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:28.107807Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:c7c2bb45e2f4a65a19ce582f6426fd408831b3fa8119b04f8d122ba1cdb050b1","observation_id":"dd2855f9-5bca-45ea-969e-eb567c9996a8","resolution":{"observed_at":"2026-08-07T11:14:28.107807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:31.093454Z","title":"Medvlm-r1: Incentivizing medical reasoning ca- pability of vision-language models (vlms) via reinforcement learning, 2025","venue":null,"work_id":"9d52e8a1-24b8-4ad3-ad9e-78cd406596b2","year":2025},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:28.186843Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:f3c79bf2a6d86d51153937862f977bf89874bd949ec901764b7b72c9cc8e1346","observation_id":"08c17e3c-3a5d-403c-b440-72646bd5320c","resolution":{"observed_at":"2026-08-07T11:14:31.178831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:30.981304Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"7bb36903-eec5-4fca-8288-4b4cf196ff93","year":2021},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:28.261259Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:e299db544b96a8ca1a68131b857936d58896d0ac839abf3d112f488b394907bd","observation_id":"298fb0c7-5478-40fc-ad63-b781ba56dcf8","resolution":{"observed_at":"2026-08-07T11:14:31.041234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:28.361137Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:28.361137Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:47687019e482f5a74bf532bb96277302cc79b05b81b17a2d25472270169ba819","observation_id":"7742fe99-1aa1-48bf-9fde-6792242a6b3b","resolution":{"observed_at":"2026-08-07T11:14:28.361137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T11:14:28.448038Z","title":"Proximal policy optimization algo- rithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:28.448038Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:89d4d9b37d5d8d49858065d29afedc64de901f1c8da852f66eb01a0e1c65ea05","observation_id":"f9c58009-197e-4dfe-8e46-e8a0dc3e55c6","resolution":{"observed_at":"2026-08-07T11:14:28.448038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T11:14:28.572354Z","title":"Deepseekmath: Pushing the limits of mathe- matical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:28.572354Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:5baa594838af711c7782d55f13f367bcb4ec64741d1b46a6567d986112847980","observation_id":"e43a7e88-60ed-4972-a6b7-ff2fe5ebbd17","resolution":{"observed_at":"2026-08-07T11:14:28.572354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:30.821742Z","title":null,"venue":null,"work_id":"5b7577eb-21b8-43a7-9d83-b76df9157012","year":2024},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:28.653266Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:beeeb7e8d85dad7ad2540dd13d1a7864d5a0359df83c45832767440f82edc3d9","observation_id":"42623fe7-8624-4ba8-aad3-ed55fcf989cf","resolution":{"observed_at":"2026-08-07T11:14:30.870663Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T11:14:28.744187Z","title":"Vlm- r1: A stable and generalizable r1-style large vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:28.744187Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:452652e13e82cc7c11b2c9d6d2490654c8097cb578dcdcfcb15f2de3b2d77ad2","observation_id":"071969d7-a674-4a0c-ae25-d3cf448472a5","resolution":{"observed_at":"2026-08-07T11:14:28.744187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T11:14:28.861844Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:28.861844Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:fa6b7ef000f2df6149d34267ab28063a605854dcf07b5b7cb7dd2bc55fff01b9","observation_id":"3badcadc-13ad-476b-9356-b973be507cc3","resolution":{"observed_at":"2026-08-07T11:14:28.861844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:28.924627Z","title":"Internvideo2.5: Empowering video mllms with long and rich context modeling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:28.924627Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:7fabe52050761b3e904024fb2061b30a65cf095cdcde8c6a92f303e1b448f555","observation_id":"e7ae7185-273b-42c0-a295-50a794bcd589","resolution":{"observed_at":"2026-08-07T11:14:28.924627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:30.643424Z","title":"Wizardlm 2, 2024","venue":null,"work_id":"d4adec6b-73fa-465b-b13a-7807b0f1f385","year":2024},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:29.032858Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:2b8617dc757ccc31f5a4a5578e89926d587b2ad65825b9504698d3a60fc240f3","observation_id":"350801aa-6cc5-4d4c-a2e3-37346c54cf80","resolution":{"observed_at":"2026-08-07T11:14:30.711275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12542","last_updated":"2025-04-23T03:44:01Z","snapshot_observed_at":"2026-08-07T17:00:29.468613Z","submitted_at":"2025-03-16T15:24:11Z","title":"ST-Think: How Multimodal Large Language Models Reason About 4D Worlds from Ego-Centric Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12542","snapshot_observed_at":"2026-08-07T11:14:29.112728Z","title":"St-think: How multimodal large language mod- els reason about 4d worlds from ego-centric videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:29.112728Z"},"links":{"cited_paper":"/paper/2503.12542","citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:bb06edd1c905bc307f8b60cdf96547f4fd94f1205a599a3afab69b44e5abd998","observation_id":"7825ea91-ba7e-42fb-a506-0c2806d66248","resolution":{"observed_at":"2026-08-07T11:14:29.112728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:30.497497Z","title":"Egolife: Towards egocentric life assistant","venue":null,"work_id":"fb5a209f-1412-4db2-8635-a750c618ef3d","year":2025},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:29.229419Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:0bd6e3f43f93511cba9018753c6dcbeca0d66e2f21b1e73777a10bb191dcd084","observation_id":"819dae82-f2af-4964-b142-c92a2946656e","resolution":{"observed_at":"2026-08-07T11:14:30.571100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:30.399225Z","title":"Mm-ego: Towards build- ing egocentric multimodal llms","venue":null,"work_id":"1f372fed-f28b-46b8-a0cc-532e21c84879","year":2025},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:29.289694Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:9aba7fc75d9ceac102f7e9285dbd2157166ccafcc1dab852cb32ed5e5c93d98e","observation_id":"f48211bc-4251-41c3-bd38-c7686456d4e3","resolution":{"observed_at":"2026-08-07T11:14:30.450637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:29.397148Z","title":"Video instruction tuning with synthetic data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:29.397148Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:64a4d8421624d5947214bbd823e5bcfc57aefead10e99639b2a76ebf2182c6e5","observation_id":"2a23480f-3d85-4f22-964e-c9c8e56192d7","resolution":{"observed_at":"2026-08-07T11:14:29.397148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:30.244506Z","title":"Llamafac- tory: Unified efficient fine-tuning of 100+ language mod- els","venue":null,"work_id":"f44e5411-7fe6-40d2-82be-ecb5c5b60c20","year":2024},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:29.444276Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:6ff1dc17b7c5f6d5726afd8386bcb11e0dda745a4b2fed3fc751349edc93178a","observation_id":"6781ea2e-d1f7-4430-a462-1821dc6db063","resolution":{"observed_at":"2026-08-07T11:14:30.310972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:30.097182Z","title":"R1-zero’s ”aha moment” in visual reasoning on a 2b non-sft model, 2025","venue":null,"work_id":"6b6d3af0-cbd3-46da-b4fb-4fc00c84c3d1","year":2025},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:29.544152Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:9545906534b6dd99ef77a6d03542f20991b228e7b394aa8e5d676c258eafb91e","observation_id":"c3d95f10-d7c8-4aaa-b7c9-c88f519f0f44","resolution":{"observed_at":"2026-08-07T11:14:30.161229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:29.921169Z","title":"Egotextvqa: Towards egocentric scene-text aware video question answering, 2025","venue":null,"work_id":"70cc27ab-a0f2-46fa-a378-1a187cdbfd16","year":2025},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:29.581142Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:540b0b4bd475e01efc4d7a13f2de02cb469458e365291637719d6ef5a59268d0","observation_id":"da53d852-81dc-4541-ae7c-4a469c6a3fa0","resolution":{"observed_at":"2026-08-07T11:14:30.027639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 5 inbound Pith citation observations for arXiv:2506.03097."}