{"as_of":"2026-08-12T15:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c6919745264478857c280e0e35d1e7eba4125c4da2fbe00613fe3c067f26ac53","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T01:59:18.438342Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.14497/citation-record","integrity":"/paper/2607.14497/integrity","json":"/paper/2607.14497/citation-record.json","paper":"/paper/2607.14497"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:14.673764Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:14.673764Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:f1303761a71b8a9ae6902c7b0a6661fea68b77412fbcd43a4c9c16cfe31cbf93","observation_id":"87102886-f169-4b84-a307-920d8b8cf547","resolution":{"observed_at":"2026-08-02T01:59:14.673764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-02T01:59:14.709112Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:14.709112Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:7d1214de4fde8e31084cd72484be374b7e8396f307798d5855b9a2b8c79caee5","observation_id":"d1baaa2c-29cd-459b-8cd8-0bd917856433","resolution":{"observed_at":"2026-08-02T01:59:14.709112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:14.760465Z","title":"Where did i leave my keys?- episodic-memory-based question answering on egocentric videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:14.760465Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:889b3694b42e11fa0da9213f0010deb6712e2268a88b3383c766ea1227c7abd1","observation_id":"c6563afa-6cfa-45d2-b7a5-fa893b1a44db","resolution":{"observed_at":"2026-08-02T01:59:14.760465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:14.813459Z","title":"Ad- abins: Depth estimation using adaptive bins","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:14.813459Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:613363eabf8ee4662f3ca30f88a74f41394467e0c69ec7fd0ae5763f38f5e72c","observation_id":"ba5afb2f-81d0-4d25-bcfd-99e37fb528cc","resolution":{"observed_at":"2026-08-02T01:59:14.813459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:14.889620Z","title":"Local- bins: Improving depth estimation by learning local distributions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:14.889620Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:ec52ea38bac759beb90762e3da7c522737a259965d8df3ddf84df1731c30ea40","observation_id":"53c3138e-a0d3-48de-b8b1-ae1269a4eec2","resolution":{"observed_at":"2026-08-02T01:59:14.889620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12288","last_updated":"2023-02-23T19:13:10Z","snapshot_observed_at":"2026-07-06T14:55:15.719380Z","submitted_at":"2023-02-23T19:13:10Z","title":"ZoeDepth: Zero-shot Transfer by Combining Relative and Metric Depth","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12288","snapshot_observed_at":"2026-08-02T01:59:14.973132Z","title":"Zoedepth: Zero-shot transfer by combining relative and metric depth.arXiv preprint arXiv:2302.12288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:14.973132Z"},"links":{"cited_paper":"/paper/2302.12288","citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:e8d50beb2019b3f3aae41436989b537698b1699dbb3ddb45019ad8afe639f91b","observation_id":"c913e4c3-f841-42a2-a44e-5bb888d908cd","resolution":{"observed_at":"2026-08-02T01:59:14.973132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:15.051371Z","title":"Scene text visual question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:15.051371Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:e8fbf161523f7847c6760675586f2ab3a63988b91dcd1b5e5d0168619d830366","observation_id":"b00dd320-b97d-4d9c-b48c-de6115cbe39c","resolution":{"observed_at":"2026-08-02T01:59:15.051371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02073","last_updated":"2025-04-21T12:09:08Z","snapshot_observed_at":"2026-08-02T06:32:26.688405Z","submitted_at":"2024-10-02T22:42:20Z","title":"Depth Pro: Sharp Monocular Metric Depth in Less Than a Second","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02073","snapshot_observed_at":"2026-08-02T01:59:15.110105Z","title":"Depth pro: Sharp monocular metric depth in less than a second.arXiv preprint arXiv:2410.02073, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:15.110105Z"},"links":{"cited_paper":"/paper/2410.02073","citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:3f99f6f693ac7bbcd3d493d2476ba41a4ec1f151e1687a0b261ad1c8183429b4","observation_id":"0904920c-fad8-4d7d-861f-109b43a2e7b4","resolution":{"observed_at":"2026-08-02T01:59:15.110105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:15.160109Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:15.160109Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:caf8dd9b8886f3f2e9625d87937a3f04edbe51e3fac26b180321740c62a6f469","observation_id":"eb49d6b0-ea75-4ba5-ad42-13c9129251b5","resolution":{"observed_at":"2026-08-02T01:59:15.160109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11623","last_updated":"2024-10-15T14:08:53Z","snapshot_observed_at":"2026-07-06T19:33:52.737083Z","submitted_at":"2024-10-15T14:08:53Z","title":"VidEgoThink: Assessing Egocentric Video Understanding Capabilities for Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11623","snapshot_observed_at":"2026-08-02T01:59:15.211777Z","title":"Videgothink: As- sessing egocentric video understanding capabilities for embodied ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:15.211777Z"},"links":{"cited_paper":"/paper/2410.11623","citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:5cda4d4a0e395fd2f672d34bda8a4bf168954f63445ddb3f92965533a6bc849e","observation_id":"edc05bd7-0390-45f0-82c1-7042fad95dfe","resolution":{"observed_at":"2026-08-02T01:59:15.211777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:15.261373Z","title":"Egothink: Evaluating first-person per- spective thinking capability of vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:15.261373Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:dd730f898f1d391781d7f4610ee3afa88223d8cf7fbb5750e1498f1cd02e8fff","observation_id":"4e551c8d-b69d-4ceb-a583-a5fa3b571b01","resolution":{"observed_at":"2026-08-02T01:59:15.261373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:15.307319Z","title":"In- structblip: Towards general-purpose vision-language models with in- struction tuning.Advances in neural information processing systems, 36:49250–49267, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:15.307319Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:4b8c7f51f76896c9c6e22e439b3fcaf113d474fcaa73522a7002469cef96f1e8","observation_id":"7200e93a-5def-46fe-bcb1-3cace70790b4","resolution":{"observed_at":"2026-08-02T01:59:15.307319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:15.366901Z","title":"Egovqa-an egocentric video question answering benchmark dataset","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:15.366901Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:b07ff6c003f843473530dad524acd5291b27b7bc6a1c5235a4085153abc604aa","observation_id":"7c6fbf91-1078-4122-86ee-f7e220cad36c","resolution":{"observed_at":"2026-08-02T01:59:15.366901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:15.370801Z","title":"Deep ordinal regression network for monocular depth estimation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:15.370801Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:4603e0e3d622affbe598da337a3d1f7af8812202f6df49063cb43aa6e8d07e0b","observation_id":"64d09369-925b-4cb3-955f-c0ca4032c1ef","resolution":{"observed_at":"2026-08-02T01:59:15.370801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:15.386825Z","title":"Geowizard: Unleash- ing the diffusion priors for 3d geometry estimation from a single im- age","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:15.386825Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:bdfeb5a27843b9c562f9d72b13d276166ed5a5d43d439467663b24d5acc7fdf3","observation_id":"a68823fd-3ddf-4389-a26b-3b300c8eedd2","resolution":{"observed_at":"2026-08-02T01:59:15.386825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:15.496125Z","title":"Unsu- pervised monocular depth estimation with left-right consistency","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:15.496125Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:d6ca7a8f70d9bc1933751cca450b00130115e2523dffa1fa45906e7b73a85822","observation_id":"a0f02a9a-0189-407b-8ee2-f0ac16bb1249","resolution":{"observed_at":"2026-08-02T01:59:15.496125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:15.635625Z","title":"Digging into self-supervised monocular depth estimation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:15.635625Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:543aba9594a4740bf470fc97aba2b66e69222ca2f74128ff8eff0a83fe4ce23f","observation_id":"8dfe3c77-c5b6-4d0e-9487-613d8a9f0a94","resolution":{"observed_at":"2026-08-02T01:59:15.635625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:15.715378Z","title":"Depthfm: Fast generative monocular depth estimation with flow matching","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:15.715378Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:5623a4c74d85c9e5436e3a37916460a024b65d97f48bf9fc7d54ef870f6a897b","observation_id":"bfd9642e-3138-4ad4-90fd-e6b1130a8b85","resolution":{"observed_at":"2026-08-02T01:59:15.715378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:15.800762Z","title":"Towards zero-shot scale-aware monocular depth es- timation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:15.800762Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:b2c28898005a961ca51d67cf3dbe8b25fb8e10ef39dc9f5e1cb906a5d0fe9294","observation_id":"b6a72b5d-c784-499e-b672-ae41c181adca","resolution":{"observed_at":"2026-08-02T01:59:15.800762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:15.915084Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:15.915084Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:4de91b02182b079396620b2de7de8c04b23582b94fffe69a7561bea736afb81c","observation_id":"1043def6-f760-4ee6-a3ee-efca78ed658f","resolution":{"observed_at":"2026-08-02T01:59:15.915084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:15.989903Z","title":"Ego- taskqa: Understanding human tasks in egocentric videos.Advances in Neural Information Processing Systems, 35:3343–3360, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:15.989903Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:941d8d14be10544d81fdfe671d53f2d8408ca13ff8be6809255f75eb7e638895","observation_id":"c3d7ac6d-e563-47cd-95ef-b71a75f18254","resolution":{"observed_at":"2026-08-02T01:59:15.989903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:16.054865Z","title":"Repurposing diffusion- based image generators for monocular depth estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:16.054865Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:a1da10ec33c781bba8c51eb3bc3b882e0ee6b595fa558052a58b39cfc98c8082","observation_id":"bedfa933-1617-41d8-be95-6468ee25ca17","resolution":{"observed_at":"2026-08-02T01:59:16.054865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-02T01:59:16.130687Z","title":"Llava-next-interleave: Tackling multi- image, video, and 3d in large multimodal models.arXiv preprint arXiv:2407.07895, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:16.130687Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:4704ded76555fc17e0ad7ba5d4ef3ceb2e23931f656f805068497ac824934780","observation_id":"aac8e7bc-8820-4dba-a97b-c697b76ec942","resolution":{"observed_at":"2026-08-02T01:59:16.130687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:16.237961Z","title":"Egocross: Benchmarking multimodal large language models for cross- domain egocentric video question answering.arXiv preprint arXiv:2508.10729, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:16.237961Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:0ccbd64f794f4b88de16f1a06f819e925c997f3510a3f4c961b90530d5ecad4c","observation_id":"f2837398-d58e-4ca5-9547-b1366468f428","resolution":{"observed_at":"2026-08-02T01:59:16.237961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.00987","last_updated":"2022-04-03T04:38:02Z","snapshot_observed_at":"2026-08-05T13:28:31.353552Z","submitted_at":"2022-04-03T04:38:02Z","title":"BinsFormer: Revisiting Adaptive Bins for Monocular Depth Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.00987","snapshot_observed_at":"2026-08-02T01:59:16.314451Z","title":"Bins- former: Revisiting adaptive bins for monocular depth estimation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:16.314451Z"},"links":{"cited_paper":"/paper/2204.00987","citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:1d35dc1e88cce79156d962ee297004b0031f0bb40c5d06a7078694e4246534e2","observation_id":"3ee1175e-1636-415f-a0b1-67519baae3d8","resolution":{"observed_at":"2026-08-02T01:59:16.314451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:16.396078Z","title":"Patchfusion: An end-to-end tile-based framework for high-resolution monocular met- ric depth estimation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:16.396078Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:840e6e3c326428b249aa941043ca15107b467e997de9fe41cfff1a8b4fe52395","observation_id":"8b4ab995-c0aa-4481-b14c-79666e8cd61d","resolution":{"observed_at":"2026-08-02T01:59:16.396078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:16.465821Z","title":"Unibind: Llm-augmented unified and balanced representation space to bind them all","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:16.465821Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:a3a9b9c9e450a165b147d61fd9d4b27413fd1a31c3803cd99e798a8471bae0a3","observation_id":"4e457fda-1d07-4c99-af11-3dc7964ebf5b","resolution":{"observed_at":"2026-08-02T01:59:16.465821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:16.610317Z","title":"Realrag: Retrieval- augmented realistic image generation via self-reflective contrastive learning.arXiv preprint arXiv:2502.00848, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:16.610317Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:95356b0b6a5dc9111df9f4a9e983bee3316dd0c8a10f56838cb53ce16efbef91","observation_id":"63523dd7-515a-4f88-a91d-3a270c51eab6","resolution":{"observed_at":"2026-08-02T01:59:16.610317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:16.686243Z","title":"Single image depth estimation: An overview.Digital Signal Processing, 123: 103441, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:16.686243Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:9ca25aa8f3befbbe150a30bbcef4fbb79c45adfd8a64a80f156cf83b2b471c10","observation_id":"f9a25bdb-33de-4010-8f4d-d7ec315278b4","resolution":{"observed_at":"2026-08-02T01:59:16.686243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20110","last_updated":"2025-12-18T09:32:11Z","snapshot_observed_at":"2026-08-08T08:28:09.948334Z","submitted_at":"2025-02-27T14:03:15Z","title":"UniDepthV2: Universal Monocular Metric Depth Estimation Made Simpler","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20110","snapshot_observed_at":"2026-08-02T01:59:16.809240Z","title":"Unidepthv2: Univer- sal monocular metric depth estimation made simpler.arXiv preprint arXiv:2502.20110, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:16.809240Z"},"links":{"cited_paper":"/paper/2502.20110","citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:370581e4d2a3aca58f0f43129f3bdabae73b6e8e2c8ef42ecaf179ca860706a7","observation_id":"75867d58-7767-4496-b5a4-60dd58376bac","resolution":{"observed_at":"2026-08-02T01:59:16.809240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:16.895759Z","title":"Towards robust monocular depth estimation: Mix- ing datasets for zero-shot cross-dataset transfer.IEEE transactions on pattern analysis and machine intelligence, 44(3):1623–1637,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:16.895759Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:c59a5263a17734f21ddb0f501e3c750de362421108d2a6ded4263bdb1e0d3783","observation_id":"19aa8d47-db44-4ab3-8735-4d50f542d48e","resolution":{"observed_at":"2026-08-02T01:59:16.895759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:16.960864Z","title":"Monocular depth estimation us- ing neural regression forest","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:16.960864Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:1c604a0de0e5e784694f5bd22a6b22bf6011c80eda023a5a8b32cb532e021021","observation_id":"aa72a3f3-6776-49ce-a8db-4fe5854726ee","resolution":{"observed_at":"2026-08-02T01:59:16.960864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:17.077636Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:17.077636Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:a0b6f23f74a547eba14e5388659359af3ec5f3d94baf9036ee1dadc9d3be5915","observation_id":"e09c48aa-acf9-4216-90f2-c1c3b39690db","resolution":{"observed_at":"2026-08-02T01:59:17.077636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13807","last_updated":"2024-06-21T09:53:41Z","snapshot_observed_at":"2026-08-12T00:20:30.030058Z","submitted_at":"2024-06-19T20:14:14Z","title":"AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13807","snapshot_observed_at":"2026-08-02T01:59:17.186399Z","title":"Alanavlm: A multimodal embodied ai foundation model for egocen- tric video understanding.arXiv preprint arXiv:2406.13807, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:17.186399Z"},"links":{"cited_paper":"/paper/2406.13807","citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:528d4baa5a8e651ffb22feb6d9a2fb467aff4a6704f4446a34aed5bcd2b9918d","observation_id":"8f5c2a54-2c1c-46d1-a50e-8ff3b43a3dcf","resolution":{"observed_at":"2026-08-02T01:59:17.186399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-02T01:59:17.304733Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:17.304733Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:26e5b54e0551ebe9d07816a08062eaa4683922d2cdadf228fad1378ce574a46f","observation_id":"58287337-48c1-4af8-bd02-c2ce6333dd5b","resolution":{"observed_at":"2026-08-02T01:59:17.304733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-02T01:59:17.406676Z","title":"Emu3: Next-token prediction is all you need.arXiv preprint arXiv:2409.18869, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:17.406676Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:ace5b09d05e6796acff192e0040b35d14b479c1c37d29fb60898835cfd720c27","observation_id":"be175290-bc13-4f19-a30c-748ab95edd3e","resolution":{"observed_at":"2026-08-02T01:59:17.406676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:17.515648Z","title":"Fastdepth: Fast monocular depth estimation on em- bedded systems","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:17.515648Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:8c0550cb948d82501757c5b4d5ebcd36a73057c4916e0e7d8e900538e30a5019","observation_id":"c0f015b3-0808-4241-8a97-b5a6fd790104","resolution":{"observed_at":"2026-08-02T01:59:17.515648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:17.647380Z","title":"Visual question answering: A survey of methods and datasets.Computer Vision and Image Understanding, 163:21–40, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:17.647380Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:b36b442c462493244cdf5f58fb3521627ab17194a5dfe4c8afb05143d0eca646","observation_id":"029520bc-4b9d-41fb-a7a1-c1ca069ee1b2","resolution":{"observed_at":"2026-08-02T01:59:17.647380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:17.731562Z","title":"Egolife: Towards egocentric life assistant","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:17.731562Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:2beffa454467eea2f6b4b70364e63bf9c456363c2be8fb0f5fb55ef6987b192f","observation_id":"b3001eee-3042-4fda-be0e-89e8fe23942b","resolution":{"observed_at":"2026-08-02T01:59:17.731562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:17.802293Z","title":"Depth anything v2.Advances in Neural Information Processing Systems, 37:21875–21911, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:17.802293Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:1b20051c8e6003870dcd6847ad62b4bf5ceb8e00dae1f9a18158dd81afb8d989","observation_id":"a0246b27-dfdb-4ffc-9442-702193a6e75b","resolution":{"observed_at":"2026-08-02T01:59:17.802293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07177","last_updated":"2025-04-13T12:27:56Z","snapshot_observed_at":"2026-08-09T06:47:11.559636Z","submitted_at":"2024-10-09T17:59:59Z","title":"MM-Ego: Towards Building Egocentric Multimodal LLMs for Video QA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07177","snapshot_observed_at":"2026-08-02T01:59:17.934979Z","title":"Mm-ego: Towards building egocentric multimodal llms for video qa","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:17.934979Z"},"links":{"cited_paper":"/paper/2410.07177","citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:eba5ae2fef26bdddcd00670f47291670accbb293f9b37b28bcef4bfd97563a66","observation_id":"9a8cce54-98b9-488c-ad2a-3b209436c2fe","resolution":{"observed_at":"2026-08-02T01:59:17.934979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:18.058550Z","title":"Metric3d: Towards zero- shot metric 3d prediction from a single image","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:18.058550Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:ce90dd915465f9892ae384ca0d8eda0ecc23b6ace337cd5c69a66ce487ce378c","observation_id":"967597eb-dbee-467e-b868-02cb603a993a","resolution":{"observed_at":"2026-08-02T01:59:18.058550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.01502","last_updated":"2022-06-06T08:55:02Z","snapshot_observed_at":"2026-08-06T03:14:28.220190Z","submitted_at":"2022-03-03T03:27:20Z","title":"NeW CRFs: Neural Window Fully-connected CRFs for Monocular Depth Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.01502","snapshot_observed_at":"2026-08-02T01:59:18.177460Z","title":"New crfs: Neural window fully-connected crfs for monocular depth estimation.arXiv preprint arXiv:2203.01502, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:18.177460Z"},"links":{"cited_paper":"/paper/2203.01502","citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:02156f8dfb850f2f5f30a118d9bffed284c876d6358197d3d6ad49bd39755ba5","observation_id":"857d1fd3-24c7-4d7b-ad72-d2e06c774bbf","resolution":{"observed_at":"2026-08-02T01:59:18.177460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:18.266673Z","title":"Egonight: Towards egocentric vision under- standing at night with a challenging benchmark.arXiv preprint arXiv:2510.06218, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:18.266673Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:6e644c762d280aacd63dd9b297e234126f6883194f6299598c27d36b24b18b41","observation_id":"ace98f0a-0237-417a-a0ad-8f059242d5c8","resolution":{"observed_at":"2026-08-02T01:59:18.266673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:18.334406Z","title":"Egotextvqa: Towards egocentric scene-text aware video question answering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:18.334406Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:aba8813d90be0378b3de944d0a5cc536a4714ad97ec3afe2a099b0a0ed6e2682","observation_id":"9400028d-e145-47f0-830b-fc6eae73cfb5","resolution":{"observed_at":"2026-08-02T01:59:18.334406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20423","last_updated":"2025-08-07T10:14:11Z","snapshot_observed_at":"2026-08-11T06:33:45.792859Z","submitted_at":"2024-12-29T10:13:30Z","title":"ESVQA: Perceptual Quality Assessment of Egocentric Spatial Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20423","snapshot_observed_at":"2026-08-02T01:59:18.438342Z","title":"Unanswerable","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:18.438342Z"},"links":{"cited_paper":"/paper/2412.20423","citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:b65fb787070f301f03398dc8d66f3f249ef2d80c1c6427731848be80f5b6caab","observation_id":"d5169957-d4f4-42c6-8280-353bf109e023","resolution":{"observed_at":"2026-08-02T01:59:18.438342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T15:21:38.374192Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2607.14497."}