{"as_of":"2026-08-11T00:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aa5659940a46f8a80c66bbe8163f0b665ae74c80bf69d05c216a566fbe604ee4","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T23:23:35.957580Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-08T01:54:30.649092Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T02:04:26.424891Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-09T15:21:28.970868Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"cited_work":{"arxiv_id":"2602.14134","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.14134","snapshot_observed_at":"2026-07-08T02:04:26.424891Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","venue":"cs.CV","work_id":"53e840bc-db1e-4322-896f-e3b906418d2c","year":2026},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"cited_paper":"/paper/2602.14134","citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:db5938008ed71d320737ccbb8308e85070ba77d6122ec76adc110660a7660c5b","observation_id":"e2fbf0c8-a908-4dbb-a474-6a0934b4ef71","resolution":{"observed_at":"2026-07-08T02:04:26.426147Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.14134/citation-record","integrity":"/paper/2602.14134/integrity","json":"/paper/2602.14134/citation-record.json","paper":"/paper/2602.14134"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:23:35.463345Z","title":"RLE string","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-09T15:21:28.970868Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:35.463345Z"},"links":{"citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:a0ad07875fe34bb4142dcdf63e0b0b03a8d0798ac9f0cf5700904630ba06331e","observation_id":"96f62d90-8e2e-41b6-ad2d-0f6fed872828","resolution":{"observed_at":"2026-08-02T23:23:35.463345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:23:35.718786Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-09T15:21:28.970868Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:35.718786Z"},"links":{"citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:c2f4835ecb62739246973da6c1d6eceb8f494cf3800c1b9a5df7c8c9aec86b68","observation_id":"658d868e-8250-4af4-8bc0-9ce006f3c349","resolution":{"observed_at":"2026-08-02T23:23:35.718786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:23:34.302345Z","title":"S., and Lin, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-09T15:21:28.970868Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:34.302345Z"},"links":{"citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:5cc5c40669fa0eec9cdd93f44a7e8182cd69f8e3fa5a5b1207f43225e77e7f2c","observation_id":"f46f50ed-9152-4b56-91ae-a312b9e0d20d","resolution":{"observed_at":"2026-08-02T23:23:34.302345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:23:34.473897Z","title":"Swinmtl: A shared architecture for simultaneous depth estimation and se- mantic segmentation from monocular camera images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-09T15:21:28.970868Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:34.473897Z"},"links":{"citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:aa2136ffe5b99abbae65a0b1e92f3fbf5c80419a11e3d445826acf30feefa61f","observation_id":"a15d26ea-df99-4243-8734-283e6f38b8eb","resolution":{"observed_at":"2026-08-02T23:23:34.473897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:23:34.644056Z","title":"Ufo: A unified approach to fine-grained visual perception via open-ended language interface.arXiv preprint arXiv:2503.01342, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-09T15:21:28.970868Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:34.644056Z"},"links":{"citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:2aa3db564d2e797def5891ac8c666eb05540156ba73ded9b5bc5e0fcc085ccd6","observation_id":"75207e2f-7548-48ec-9a5b-1503e99d3947","resolution":{"observed_at":"2026-08-02T23:23:34.644056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-02T23:23:34.805229Z","title":"org/abs/2502.14786","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-09T15:21:28.970868Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:34.805229Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:e5810b6e25b38a3c88370573f95a7af2fd390df5175b9758f09568e3b7b1d280","observation_id":"52b6dc11-bfab-4cda-ac4c-669226af52ec","resolution":{"observed_at":"2026-08-02T23:23:34.805229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11175","last_updated":"2023-05-25T15:02:07Z","snapshot_observed_at":"2026-07-06T15:29:20.405296Z","submitted_at":"2023-05-18T17:59:42Z","title":"VisionLLM: Large Language Model is also an Open-Ended Decoder for Vision-Centric Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11175","snapshot_observed_at":"2026-08-02T23:23:34.980496Z","title":"K., Singhal, S., Som, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-09T15:21:28.970868Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:34.980496Z"},"links":{"cited_paper":"/paper/2305.11175","citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:264d814ed2bd7b0cb568e02667e3b3bfdeac20256a579acaf1d0411b0750ad70","observation_id":"bd6dfdfe-4afe-437f-a1a5-f4490fc688d6","resolution":{"observed_at":"2026-08-02T23:23:34.980496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-02T23:23:35.129957Z","title":"Wu, J., Zhong, M., Xing, S., Lai, Z., Liu, Z., Chen, Z., Wang, W., Zhu, X., Lu, L., Lu, T., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-09T15:21:28.970868Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:35.129957Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:db7bb0c3df4ef98983eda5a40f2d9ef14010b97b6c93d239d4c4a0a44cf00a2e","observation_id":"6645d106-7b66-4803-9bb6-a7c6d0e446d4","resolution":{"observed_at":"2026-08-02T23:23:35.129957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-02T23:23:35.241079Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-09T15:21:28.970868Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:35.241079Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:03acf002d94111427b021125c25464eb4b182f0c2c522dea9d94d00e8999754a","observation_id":"e52d6eb0-fe4a-4304-ad84-425e73b3fbdd","resolution":{"observed_at":"2026-08-02T23:23:35.241079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:23:35.288627Z","title":"Visual representation alignment for multimodal large language models.arXiv preprint arXiv:2509.07979,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-09T15:21:28.970868Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:35.288627Z"},"links":{"citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:c34416971064ab31ab8a2631a189d470400429e10f0d615481b69efd2ec05c62","observation_id":"94644f63-9640-493d-983b-78c3f719e063","resolution":{"observed_at":"2026-08-02T23:23:35.288627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:23:35.634650Z","title":"Semantic Segmentation for the Open World","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-09T15:21:28.970868Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:35.634650Z"},"links":{"citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:79814b1905c590f1ff63aaee8f9b0398e57303b2a7c94c50b9c76361db8ac7e8","observation_id":"af58203f-071f-47fd-b286-8d4ed74fdd03","resolution":{"observed_at":"2026-08-02T23:23:35.634650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:23:35.775714Z","title":"RLE string","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-09T15:21:28.970868Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:35.775714Z"},"links":{"citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:9999307ab642bb3ede6609cbb80199e75208eb75ffa602e6f31fc7b5883502b8","observation_id":"f7980be9-7a39-448f-b585-91aa30436ebd","resolution":{"observed_at":"2026-08-02T23:23:35.775714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:23:35.957580Z","title":"During testing, the predicted values need to be de-quantized to obtain the real depth; otherwise, only relative depth is obtained","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-09T15:21:28.970868Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:35.957580Z"},"links":{"citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:37566117e24cb46f75321ae72d1a02d38d1561c850e2c4014b150e5e0589289a","observation_id":"721c078c-2fcd-468f-83c6-d0306fc8ebe2","resolution":{"observed_at":"2026-08-02T23:23:35.957580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:23:35.913684Z","title":"During testing, we dequantize to the actual depths and exclude invalid depths","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-09T15:21:28.970868Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":1000,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:35.913684Z"},"links":{"citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:3ab3617bc4b418863e01691a50fa00acae328304e64890fbed9b5a52889e117a","observation_id":"1e295596-64b2-4160-a1f5-c77d0116f190","resolution":{"observed_at":"2026-08-02T23:23:35.913684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:23:33.922033Z","title":"Token activation map to visually explain multimodal llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-09T15:21:28.970868Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:33.922033Z"},"links":{"citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:e62ad5d81629e6f5225d3f453cd2b5c5d524b3cff9b81685fc900cf661ae4152","observation_id":"e449bbf3-80e5-470f-b876-fd81be049334","resolution":{"observed_at":"2026-08-02T23:23:33.922033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-09T18:02:17.307812Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-02T23:23:34.118285Z","title":"Dinov2: Learning robust visual features without supervision.arXiv preprint arXiv:2304.07193,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-09T15:21:28.970868Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:34.118285Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:c30b35352415c55b4f0e5c214ea07216b9e6ceb1bad0830864faeeb4eb2de27e","observation_id":"1451865a-7c9a-4791-9a06-15a32fff1dfe","resolution":{"observed_at":"2026-08-02T23:23:34.118285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-02T23:23:35.367262Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-09T15:21:28.970868Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:35.367262Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:748cccfd329797aeb22676d181c7f444db0772644a4494c8f3afefb9cf65e062","observation_id":"0872b2d1-4d96-4fd7-a576-8b93f4c585a0","resolution":{"observed_at":"2026-08-02T23:23:35.367262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:23:33.985256Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-09T15:21:28.970868Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:33.985256Z"},"links":{"citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:32772aa15441feaee7002adcaa846d33ab38287d0a32febb7ec4f9b4fae37a13","observation_id":"4008008e-1e56-4c2a-9d80-8aef88889994","resolution":{"observed_at":"2026-08-02T23:23:33.985256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:23:33.622893Z","title":"Depthlm: Metric depth from vision language models.arXiv preprint arXiv:2509.25413,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-09T15:21:28.970868Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:33.622893Z"},"links":{"citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:ca58df99ba2a40a1e3332a10e9a6f1b21b98b3d344b4b93ce3b18ed9133afb5c","observation_id":"ac3b1f72-e304-4413-aa12-aa9b707e7c18","resolution":{"observed_at":"2026-08-02T23:23:33.622893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-02T23:23:33.484278Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-09T15:21:28.970868Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:33.484278Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:e2561aed0c06d9256e16db414e5331aa2060f0c400bc22febc383fa5d99feb04","observation_id":"83e0c2c3-6ba3-4fb7-8596-b705792efcad","resolution":{"observed_at":"2026-08-02T23:23:33.484278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20110","last_updated":"2025-12-18T09:32:11Z","snapshot_observed_at":"2026-08-08T08:28:09.948334Z","submitted_at":"2025-02-27T14:03:15Z","title":"UniDepthV2: Universal Monocular Metric Depth Estimation Made Simpler","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20110","snapshot_observed_at":"2026-08-02T23:23:34.181055Z","title":"Unidepthv2: Universal monocular metric depth estimation made simpler.arXiv preprint arXiv:2502.20110,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-09T15:21:28.970868Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:34.181055Z"},"links":{"cited_paper":"/paper/2502.20110","citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:68a6613d4d07b8d56fe13365061c7d9d97703327181c1970dcd21c251d70b38c","observation_id":"1e66a50c-6327-46c8-b119-652a6d6c6a69","resolution":{"observed_at":"2026-08-02T23:23:34.181055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-08-02T23:23:33.793070Z","title":"V ., Khedr, H., Huang, A., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-09T15:21:28.970868Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:33.793070Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:6517181f120b996b25bce6b0135269d7f2844b8f71d56fc0b975d80c306d1ff8","observation_id":"081f0df1-d124-4cc9-abe0-b3032db15574","resolution":{"observed_at":"2026-08-02T23:23:33.793070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:23:34.046942Z","title":"Lu, P., Bansal, H., Xia, T., Liu, J., Li, C., Hajishirzi, H., Cheng, H., Chang, K., Galley, M., and Gao, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-09T15:21:28.970868Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:34.046942Z"},"links":{"citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:77e1bb5c7ecbfb0c560276c40c964b22430ead73ea6fbf3a43650922b40f1596","observation_id":"c736002b-5762-44f3-92ec-012ce0ce4a4b","resolution":{"observed_at":"2026-08-02T23:23:34.046942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T15:21:28.970868Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 1 inbound Pith citation observation for arXiv:2602.14134."}