{"as_of":"2026-08-10T12:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:65d7b9b80b840830a20df64eff1bab3463d92d04ca255981c75ff3f20d6e44b3","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:55:41.094698Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T01:20:57.490329Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T13:36:09.422158Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-10T10:46:06.014073Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"cited_work":{"arxiv_id":"2507.04289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04289","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M 3-med: A benchmark for multi-lingual, multi-modal, and multi- hop reasoning in medical instructional video understanding","venue":null,"work_id":"d10f1b28-cf21-41b4-bc05-593371c03210","year":2025},"citing_paper":{"arxiv_id":"2604.20319","last_updated":"2026-04-22T08:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-22T08:18:21Z","title":"SurgCoT: Advancing Spatiotemporal Reasoning in Surgical Videos through a Chain-of-Thought Benchmark","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T01:20:57.490329Z"},"links":{"cited_paper":"/paper/2507.04289","citing_paper":"/paper/2604.20319"},"observation_digest":"sha256:37bada4cb7d41bec0b366530ca09149b2c26350c0d96ea3b0270d304e87dd096","observation_id":"933f59fc-0aec-49c4-84c3-d75423ceffb0","resolution":{"observed_at":"2026-05-11T13:36:09.424530Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.04289/citation-record","integrity":"/paper/2507.04289/integrity","json":"/paper/2507.04289/citation-record.json","paper":"/paper/2507.04289"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:44.666188Z","title":"Video-language understanding: A survey from model architecture, model training, and data perspectives","venue":null,"work_id":"1b2d7a32-1931-4a34-a25a-bcbbf02ff508","year":2024},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-10T10:46:06.014073Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.848927Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:d52a1f2f5719c565d17da6bf349f18f5e5bde758bb2cb7497ed0c28a805bcd20","observation_id":"8e558589-f8de-4e52-94e3-437561ebe7c9","resolution":{"observed_at":"2026-08-06T19:55:44.767844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15918","last_updated":"2025-04-23T03:01:06Z","snapshot_observed_at":"2026-08-10T10:46:28.508941Z","submitted_at":"2025-04-22T14:03:16Z","title":"Ask2Loc: Learning to Locate Instructional Visual Answers by Asking Questions","version":2},"cited_work":{"arxiv_id":"2504.15918","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.15918","snapshot_observed_at":"2026-08-06T19:55:41.494044Z","title":"Ask2Loc: Learning to Locate Instructional Visual Answers by Asking Questions","venue":"cs.CV","work_id":"b05ee377-1963-4a1a-b7a5-ce83410aeae4","year":2025},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-10T10:46:06.014073Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.858859Z"},"links":{"cited_paper":"/paper/2504.15918","citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:679a06f89ead2b5437197ec7fb37334bc596b724839d88d7fdd8d7e61679f7ce","observation_id":"88150503-529d-4efc-a184-218b1afd31e3","resolution":{"observed_at":"2026-08-06T19:55:41.566893Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:44.476914Z","title":"Dense-captioning events in videos","venue":null,"work_id":"e3ff9b10-73a2-40d9-ba2b-52333e67d726","year":2017},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-10T10:46:06.014073Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.864125Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:d569a045a2665094f93b6fd4cfbbdf55e3bca691ea38e4ebd7b51a7239da3137","observation_id":"61e1c16c-3f56-426a-b742-6e40a45e8ac0","resolution":{"observed_at":"2026-08-06T19:55:44.559761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:43.888905Z","title":"Towards answering health-related questions from medical videos: Datasets and approaches","venue":null,"work_id":"973679ef-4f46-4901-a095-058294a20f0c","year":2024},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-10T10:46:06.014073Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.886100Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:3bf893d0096ae68fbdf88225a2fa1e1104b09162bd00a3ba9f25fb166792bb62","observation_id":"ebc40eaf-9248-4aeb-bb84-07ca8691b617","resolution":{"observed_at":"2026-08-06T19:55:44.021480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:43.718316Z","title":"18 Wangyu Wu, Siqi Song, Xianglin Qiu, Xiaowei Huang, Fei Ma, and Jimin Xiao","venue":null,"work_id":"6db9b5fe-1217-474a-8332-4f8cbde63433","year":2025},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-10T10:46:06.014073Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.894079Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:a3355f0326887a6526e6746cda3e79d18f51c2c3719af0a67e83ac482adef5ac","observation_id":"f22ac4af-4eff-423e-8976-e0ea004ceb77","resolution":{"observed_at":"2026-08-06T19:55:43.777750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:43.589977Z","title":"19 Zhen Yao, Jiawei Xu, Shuhang Hou, and Mooi Choo Chuah","venue":null,"work_id":"dcc9de93-b8cd-46c1-8299-99cc2207029c","year":2024},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-10T10:46:06.014073Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.904604Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:22da18ac49a9948db101bb4befdc25e445bd685884c87a5d5b7e1df38cbb6f21","observation_id":"9ccbc03a-aaf9-430f-88c4-4edd46f6cdb5","resolution":{"observed_at":"2026-08-06T19:55:43.646010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:43.205961Z","title":"Overview of the nlpcc 2023 shared task: Chinese medical instructional video question answering","venue":null,"work_id":"c06a2c88-d1bf-4001-b3d0-f052c718212c","year":2023},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-10T10:46:06.014073Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.931997Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:c81f4c2c3f018938ca357db45b52a996f9bf20966cfcfc2fb191f08a23b0aee3","observation_id":"09da3542-cf8d-43d1-b446-3fa285a370ac","resolution":{"observed_at":"2026-08-06T19:55:43.298365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:42.945833Z","title":"24 Bin Li, Yixuan Weng, Qiya Song, Lianhui Liang, Xianwen Min, and Shoujun Zhou","venue":null,"work_id":"980eda9c-30b6-4f1e-991b-4219b33b03c0","year":2024},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-10T10:46:06.014073Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.939915Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:1fc0898bdbb54efd26d3c2368a2f9ed7724d0728eae78765e11eb5c5cdfe313f","observation_id":"77563452-5055-4816-bebd-e27259f64448","resolution":{"observed_at":"2026-08-06T19:55:43.049156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:42.765397Z","title":"25 Bin Li, Shenxi Liu, Yixuan Weng, Yue Du, Yuhang Tian, and Shoujun Zhou","venue":null,"work_id":"5190246b-4c4f-4a19-a7da-50b1e62c0e60","year":2025},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-10T10:46:06.014073Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.955363Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:f9a986cc57d013cf45aa954dd9a90d41d2ccde9a0ab11bee87e36cac65d48b92","observation_id":"9117250d-5134-4312-8b97-ee9f67768324","resolution":{"observed_at":"2026-08-06T19:55:42.846058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:42.608476Z","title":"FCMR: Robust evaluation of financial cross-modal multi-hop reasoning","venue":null,"work_id":"885b7755-5e06-484a-bba1-afa027fbfc7c","year":2024},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-10T10:46:06.014073Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.968361Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:c72c24416e3a5e67c42d09baae240450c62e917bd7137f5565085eed3c0fa580","observation_id":"afd4d8b0-394e-4e57-bc29-8d4255a74d3d","resolution":{"observed_at":"2026-08-06T19:55:42.669923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:42.442216Z","title":"Rosenblum","venue":null,"work_id":"3c381876-2d9c-4057-90c5-3ef321c2eeab","year":2019},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-10T10:46:06.014073Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.981325Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:c6bac3fc44e5f9e11072607ee084c3a4f484fd1f834179106ab3a6bd2edb903f","observation_id":"fd775883-6eaa-4203-9851-fdd29d733145","resolution":{"observed_at":"2026-08-06T19:55:42.503693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.05423","last_updated":"2023-03-02T01:52:48Z","snapshot_observed_at":"2026-07-06T14:03:38.013152Z","submitted_at":"2022-10-11T13:04:59Z","title":"Learning to Locate Visual Answer in Video Corpus Using Question","version":4},"cited_work":{"arxiv_id":"2210.05423","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.05423","snapshot_observed_at":"2026-08-06T19:55:41.190600Z","title":"Learning to Locate Visual Answer in Video Corpus Using Question","venue":"cs.CV","work_id":"f65852e6-442b-449e-9960-463445242204","year":2022},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-10T10:46:06.014073Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:41.006696Z"},"links":{"cited_paper":"/paper/2210.05423","citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:6d923d3e9bccfdcf6d29a9c26d2c3ab0bba75e9a6291bc14ec84e9eab74405c6","observation_id":"abcad994-5377-4ac4-beee-cece2c0fd05e","resolution":{"observed_at":"2026-08-06T19:55:41.243092Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:42.115296Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":"f374c99c-4111-4fb9-9e97-cf1156632ca5","year":2019},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-10T10:46:06.014073Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:41.016707Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:36488cdfdb9b58116df98f90ced4cfefc0c318333e0f67c4a1ad8f51b2e4f36e","observation_id":"959f91af-2469-4faa-9d74-095e315f53d7","resolution":{"observed_at":"2026-08-06T19:55:42.197129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-06T19:55:41.025430Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-10T10:46:06.014073Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:41.025430Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:b2bd5d9ab939000fdeda2b65d335d77c6b8fd46d7c3c2a48fe143e623c12e700","observation_id":"6e19e462-a9b6-4018-9333-7a59fa32c54d","resolution":{"observed_at":"2026-08-06T19:55:41.025430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:41.964504Z","title":"Sentence-BERT: Sentence embeddings using Siamese BERT-networks","venue":null,"work_id":"0f198ca7-ff9e-47c3-a09d-5e46a0b4e7a4","year":2019},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-10T10:46:06.014073Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:41.065943Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:25a03741f8727750e2e36665338cbb498348b8993d2be9be3abd9e2573402635","observation_id":"47f8b8c1-3793-4033-abbe-22c06b1e2e3b","resolution":{"observed_at":"2026-08-06T19:55:42.046479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:41.838924Z","title":"43 Zhongzhi Chen, Guang Liu, Bo-Wen Zhang, Qinghong Yang, and Ledell Wu","venue":null,"work_id":"cc9e3247-73d6-4d4e-92b7-c0f4ae7ac3ce","year":2023},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-10T10:46:06.014073Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:41.094698Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:3d2888628f904c1ed95a9d6768419bfa4bc616122c1deccfed20fc719bdc55d1","observation_id":"b47a3d3b-b6cf-498d-824e-6139ffeb4266","resolution":{"observed_at":"2026-08-06T19:55:41.876846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:44.304320Z","title":"Learning to segment actions from visual and language instructions via differentiable weak sequence alignment","venue":null,"work_id":"eeb52068-ede5-4492-a5dd-e00c53e3030e","year":2021},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-10T10:46:06.014073Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.869419Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:2a2ed540ac33a4d3f6ed8f9dfd6c51532adcf157efb39ef6d9f8ad45ae7dd5e4","observation_id":"1dbacb54-5993-45b6-bffd-af70585129a2","resolution":{"observed_at":"2026-08-06T19:55:44.376483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:42.287537Z","title":"29 Yixuan Weng and Bin Li","venue":null,"work_id":"41c974ee-fdfc-4c83-ad6c-15802aa632ae","year":2023},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-10T10:46:06.014073Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.997756Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:65b27c6c4fa6e74e8c420d7d69073ae2cab22612e5be7b9edfd029ba75d97a38","observation_id":"2c5f6c14-1043-4637-aa52-287ddd85ba81","resolution":{"observed_at":"2026-08-06T19:55:42.371022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13347","last_updated":"2023-10-20T08:22:56Z","snapshot_observed_at":"2026-08-05T04:29:31.007689Z","submitted_at":"2023-10-20T08:22:56Z","title":"NurViD: A Large Expert-Level Video Database for Nursing Procedure Activity Understanding","version":1},"cited_work":{"arxiv_id":"2310.13347","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.13347","snapshot_observed_at":"2026-08-06T19:55:41.338547Z","title":"NurViD: A Large Expert-Level Video Database for Nursing Procedure Activity Understanding","venue":"cs.CV","work_id":"d91e31bb-26a8-4b88-88ca-07b73ec4cf05","year":2023},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-10T10:46:06.014073Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.879906Z"},"links":{"cited_paper":"/paper/2310.13347","citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:f744e06d15cfc7a3cf9e65aa5bc50d0f1b59b905fc86ac930bd9b392234a7009","observation_id":"473ed0fc-616c-46b1-a6b0-c80447ec3472","resolution":{"observed_at":"2026-08-06T19:55:41.397567Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:44.099262Z","title":"Movienet: A holistic dataset for movie understanding","venue":null,"work_id":"cb2b9373-7b39-41f5-886c-7dd4e1db7a43","year":2020},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-10T10:46:06.014073Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.874654Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:9a9cd44f3324c803f392dfe87b8d2dc9874930c638a90682f0880000037867a0","observation_id":"e78c0636-7dc6-45ad-8a77-2beb9fe0786f","resolution":{"observed_at":"2026-08-06T19:55:44.194492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:43.409703Z","title":"Buch, Cristobal Eyzaguirre, Adrien Gaidon, Jiajun Wu, Li Fei-Fei, and Juan Carlos Niebles","venue":null,"work_id":"d8738fc2-7ffd-4c36-89bd-5800e84564f3","year":2022},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-10T10:46:06.014073Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.918432Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:1d1a9774b146adbdcf65a9613a286f5053a2f77063c5591acbd0c32dcf707ae8","observation_id":"b1f7998a-f06c-4a11-8ce7-f89296260b84","resolution":{"observed_at":"2026-08-06T19:55:43.500908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:44.844768Z","title":"Sci China Inf Sci 16 5 Xingjian Diao, Chunhui Zhang, Weiyi Wu, Zhongyu Ouyang, Peijun Qing, Ming Cheng, Soroush Vosoughi, and Jiang Gui","venue":null,"work_id":"3bfa2335-7325-4278-a967-7ecadecf854c","year":2025},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-10T10:46:06.014073Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.837430Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:6c6a5a3d9ad0f8f366b216e23fbf0df458eba939d1ff2a88b77e2546d713173e","observation_id":"fec5053b-15a4-418f-8b56-792bc45af0a3","resolution":{"observed_at":"2026-08-06T19:55:44.923865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02851","last_updated":"2024-11-05T06:49:14Z","snapshot_observed_at":"2026-07-06T19:45:21.541944Z","submitted_at":"2024-11-05T06:49:14Z","title":"Learning to Unify Audio, Visual and Text for Audio-Enhanced Multilingual Visual Answer Localization","version":1},"cited_work":{"arxiv_id":"2411.02851","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.02851","snapshot_observed_at":"2026-08-06T19:55:41.663672Z","title":"Learning to Unify Audio, Visual and Text for Audio-Enhanced Multilingual Visual Answer Localization","venue":"cs.MM","work_id":"2bf20d62-b1a1-49da-a6ca-87f5c76bef8f","year":2024},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-10T10:46:06.014073Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.853738Z"},"links":{"cited_paper":"/paper/2411.02851","citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:4b70e9544ab701125e46e0c9392309161d578033154137d5b70078d04eed7a42","observation_id":"ae9b021d-1696-414d-a9a4-0abf85f939f4","resolution":{"observed_at":"2026-08-06T19:55:41.732422Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04606","last_updated":"2025-06-11T04:23:47Z","snapshot_observed_at":"2026-08-10T10:45:40.385181Z","submitted_at":"2025-01-08T16:41:31Z","title":"Enhancing Low-Cost Video Editing with Lightweight Adaptors and Temporal-Aware Inversion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04606","snapshot_observed_at":"2026-08-06T19:55:40.843380Z","title":"6 Yangfan He, Sida Li, Kun Li, Jianhui Wang, Binxu Li, Tianyu Shi, Jun Yin, Miao Zhang, and Xueqian Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-10T10:46:06.014073Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.843380Z"},"links":{"cited_paper":"/paper/2501.04606","citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:96fdaaad82970c4eaa40018b46a3efcd82867752ca70463e8a8ae0fcd2618cf0","observation_id":"f3f3491b-2274-4d88-86c8-02bebe49370f","resolution":{"observed_at":"2026-08-06T19:55:40.843380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T10:46:06.014073Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":2,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 1 inbound Pith citation observation for arXiv:2507.04289."}