{"as_of":"2026-08-10T00:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3e71d679b006066a874436ee185b2ed96eb63b7127626890aede0ed6fb42a9dc","coverage":[{"denominator":88,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":88,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:26:44.013878Z","state":"measured"},{"denominator":97,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":97,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:16:27.620334Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":2,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"cited_work":{"arxiv_id":"2506.02555","doi":"10.48550/arxiv.2506.02555","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Surgvlm: A large vision-language model and systematic evaluation benchmark for surgical in- telligence","venue":"ArXiv.org","work_id":"a89a6b78-767d-431d-9abe-a39e6a41258f","year":2025},"citing_paper":{"arxiv_id":"2604.09037","last_updated":"2026-04-10T06:58:29Z","snapshot_observed_at":"2026-08-05T06:31:53.723325Z","submitted_at":"2026-04-10T06:58:29Z","title":"SiMing-Bench: Evaluating Procedural Correctness from Continuous Interactions in Clinical Skill Videos","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-10T17:37:40.373211Z"},"links":{"cited_paper":"/paper/2506.02555","citing_paper":"/paper/2604.09037"},"observation_digest":"sha256:bbed8f840a5cd2bb9776fa579f2d8b07680d931929e6233ae4d7a34f12a9622a","observation_id":"dae74437-f337-4167-8bbc-1122a3242d7f","resolution":{"observed_at":"2026-05-11T06:30:58.495653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"cited_work":{"arxiv_id":"2506.02555","doi":"10.48550/arxiv.2506.02555","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Surgvlm: A large vision-language model and systematic evaluation benchmark for surgical in- telligence","venue":"ArXiv.org","work_id":"a89a6b78-767d-431d-9abe-a39e6a41258f","year":2025},"citing_paper":{"arxiv_id":"2604.10233","last_updated":"2026-04-11T14:36:05Z","snapshot_observed_at":"2026-08-02T17:45:19.531231Z","submitted_at":"2026-04-11T14:36:05Z","title":"Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:02.337806Z"},"links":{"cited_paper":"/paper/2506.02555","citing_paper":"/paper/2604.10233"},"observation_digest":"sha256:150f61fc9ddf1f16a781fc2b7c9330607148bc235600aa0e544a43b256af9961","observation_id":"96144497-895a-42ca-8828-9ccef4c52098","resolution":{"observed_at":"2026-05-11T08:20:58.221059Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"cited_work":{"arxiv_id":"2506.02555","doi":"10.48550/arxiv.2506.02555","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Surgvlm: A large vision-language model and systematic evaluation benchmark for surgical in- telligence","venue":"ArXiv.org","work_id":"a89a6b78-767d-431d-9abe-a39e6a41258f","year":2025},"citing_paper":{"arxiv_id":"2604.20319","last_updated":"2026-04-22T08:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-22T08:18:21Z","title":"SurgCoT: Advancing Spatiotemporal Reasoning in Surgical Videos through a Chain-of-Thought Benchmark","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T01:20:57.490329Z"},"links":{"cited_paper":"/paper/2506.02555","citing_paper":"/paper/2604.20319"},"observation_digest":"sha256:5a35b89820a630c9af3ed24c6bdc7e157fc3ca20eeb8878d5a61763a1d41c42f","observation_id":"fbaaae2f-b5e0-4082-bee6-8fcb0a7c7c43","resolution":{"observed_at":"2026-05-11T13:36:09.429885Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"cited_work":{"arxiv_id":"2506.02555","doi":"10.48550/arxiv.2506.02555","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Surgvlm: A large vision-language model and systematic evaluation benchmark for surgical in- telligence","venue":"ArXiv.org","work_id":"a89a6b78-767d-431d-9abe-a39e6a41258f","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":268,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2506.02555","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:1c9866273260d71d350e8a867f065d66b43c9507d8086f5db6f51bef3af271ba","observation_id":"c65108b3-6832-4304-a2ad-88a4e996827d","resolution":{"observed_at":"2026-07-02T17:27:15.691006Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"cited_work":{"arxiv_id":"2506.02555","doi":"10.48550/arxiv.2506.02555","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Surgvlm: A large vision-language model and systematic evaluation benchmark for surgical in- telligence","venue":"ArXiv.org","work_id":"a89a6b78-767d-431d-9abe-a39e6a41258f","year":2025},"citing_paper":{"arxiv_id":"2606.08071","last_updated":"2026-06-06T09:45:45Z","snapshot_observed_at":"2026-07-06T23:47:38.671681Z","submitted_at":"2026-06-06T09:45:45Z","title":"SurgiQ: A Large-Scale Multi-Domain Benchmark for Evaluating Surgical Understanding in Large Language Models","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-06-27T19:37:29.336671Z"},"links":{"cited_paper":"/paper/2506.02555","citing_paper":"/paper/2606.08071"},"observation_digest":"sha256:03d673332fac1f3b997d5222deea81edfba68c667a5d7d59d547b8d7649f0bb5","observation_id":"0c4774a1-6508-40b4-b2da-5a4aacc9d219","resolution":{"observed_at":"2026-06-27T19:41:12.037947Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"cited_work":{"arxiv_id":"2506.02555","doi":"10.48550/arxiv.2506.02555","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Surgvlm: A large vision-language model and systematic evaluation benchmark for surgical in- telligence","venue":"ArXiv.org","work_id":"a89a6b78-767d-431d-9abe-a39e6a41258f","year":2025},"citing_paper":{"arxiv_id":"2606.25905","last_updated":"2026-06-24T14:53:56Z","snapshot_observed_at":"2026-07-07T00:00:17.090702Z","submitted_at":"2026-06-24T14:53:56Z","title":"SurgAtlas: A Large-Scale Surgical Video-Language Dataset with 2,391 Hours of Open and Minimally Invasive Surgery","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-25T20:39:21.354834Z"},"links":{"cited_paper":"/paper/2506.02555","citing_paper":"/paper/2606.25905"},"observation_digest":"sha256:a521d36f373d356051a9091b1ac2cf74d2ba95e49b0463f175bd49403ac87122","observation_id":"1fa95e6b-2896-41eb-af80-f37239e7d809","resolution":{"observed_at":"2026-07-04T20:10:07.448134Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02555","snapshot_observed_at":"2026-08-01T11:31:02.706758Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19889","last_updated":"2026-07-22T08:20:52Z","snapshot_observed_at":"2026-08-08T10:17:50.117528Z","submitted_at":"2026-07-22T08:20:52Z","title":"LAVIFT: Latent-Action-Guided Vision Fine-Tuning for Surgical Interaction Recognition","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T11:31:02.706758Z"},"links":{"cited_paper":"/paper/2506.02555","citing_paper":"/paper/2607.19889"},"observation_digest":"sha256:c210375341b53421b330505051163e835fb2522603b02ef1a56c19ee9cab405b","observation_id":"61ddf5ee-050e-4002-8d1d-b67130108209","resolution":{"observed_at":"2026-08-01T11:31:02.706758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02555","snapshot_observed_at":"2026-07-31T23:10:29.516601Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:29.516601Z"},"links":{"cited_paper":"/paper/2506.02555","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:a31a7337c2b12be2cde42ce48a94b96df403512e8ade3a762c00e71b8797c902","observation_id":"05a2e1cd-382f-428c-9eff-a8a348db8818","resolution":{"observed_at":"2026-07-31T23:10:29.516601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02555","snapshot_observed_at":"2026-08-06T19:16:27.620334Z","title":"SurgVLM: A large vision-language model and sys- tematic evaluation benchmark for surgical intelligence,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-09T21:48:13.774740Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:27.620334Z"},"links":{"cited_paper":"/paper/2506.02555","citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:617fe8f29d09d308ec6444b88b537ec99960f2338f13c46296fd31f2a30b8149","observation_id":"4b4d878f-5b6e-40f6-9069-78358e2fbd1e","resolution":{"observed_at":"2026-08-06T19:16:27.620334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02555/citation-record","integrity":"/paper/2506.02555/integrity","json":"/paper/2506.02555/citation-record.json","paper":"/paper/2506.02555"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-08-09T11:59:10.408717Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-07T11:26:37.239408Z","title":"Phi-4-mini technical report: Com- pact yet powerful multimodal language models via mixture-of-loras","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:37.239408Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:77988a4f42d97666434b036a5ea226ec67c32e51b21b48d3d1e0d00ed616d705","observation_id":"e2152a53-338f-49bd-8695-837846db1a4e","resolution":{"observed_at":"2026-08-07T11:26:37.239408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:37.285037Z","title":"Cholecinstanceseg: A tool instance segmen- tation dataset for laparoscopic surgery, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:37.285037Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:8e1d6a687bf05686d72fc02c31ca750c035117928af13e3db5739da4a1f009e2","observation_id":"45ff216c-6d84-423a-9fe1-6ccfa2ebe7b7","resolution":{"observed_at":"2026-08-07T11:26:37.285037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:37.338475Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:37.338475Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:0158cae3fb7ca076700a375055d15b1e58ed124f8de2c0fe7d5f1ff429365a2e","observation_id":"7b138aaf-e228-4ad3-b1ac-264190f59f5d","resolution":{"observed_at":"2026-08-07T11:26:37.338475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.06426","last_updated":"2019-02-21T17:01:02Z","snapshot_observed_at":"2026-08-07T15:18:47.460768Z","submitted_at":"2019-02-18T07:08:36Z","title":"2017 Robotic Instrument Segmentation Challenge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.06426","snapshot_observed_at":"2026-08-07T11:26:37.402107Z","title":"2017 robotic instrument segmentation and track- ing challenge","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:37.402107Z"},"links":{"cited_paper":"/paper/1902.06426","citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:b09e053929f40de2522a9bb409bbca1a1bc4e68d829cf179e5d4921433384c04","observation_id":"b90920a1-3940-4c9a-b1e2-072359f503ec","resolution":{"observed_at":"2026-08-07T11:26:37.402107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:37.471200Z","title":"Pixel-wise recognition for holistic surgical scene under- standing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:37.471200Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:3aced142b0185c89a17f8c9d9fb7508105f84305addb57ce1766014a2f3f6329","observation_id":"c8c2fae3-b9d2-486c-a79b-252e93bc6e4a","resolution":{"observed_at":"2026-08-07T11:26:37.471200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:37.523236Z","title":"Surgical-vqla: Transformer with gated vision-language embedding for visual ques- tion localized-answering in robotic surgery","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:37.523236Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:4dc23c5fed18cf9c49c4d774ba7b252dfa0dc5679a9748de8e5b0a7d13dbd097","observation_id":"e3424534-8919-4178-ba63-55d565b9471b","resolution":{"observed_at":"2026-08-07T11:26:37.523236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T11:26:37.570669Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:37.570669Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:451fc05722acc55a8ac36797f21b6b4be616cb2bcf89c5e83b810f2a6fb9bc2a","observation_id":"81d338e4-99aa-45dd-bdaa-f976de9bf6eb","resolution":{"observed_at":"2026-08-07T11:26:37.570669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:37.643239Z","title":"Curriculum learning","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:37.643239Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:b0d8b1286946284c1504a3b46e3fc050456e9f914ba69ad180666de65841e36b","observation_id":"edd8eaff-da8d-496b-9c76-6e12bbcbb9d9","resolution":{"observed_at":"2026-08-07T11:26:37.643239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:37.687729Z","title":"De- tecting surgical tools by modelling local appearance and global shape","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:37.687729Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:617618c9b99b0485b1109cf5484c3a15ff1fcbe90606e8240fe2b8f849af6fa2","observation_id":"6c2311f1-407c-4093-91db-99a330891050","resolution":{"observed_at":"2026-08-07T11:26:37.687729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:37.734119Z","title":"Rinner, Sebastian Bo- denstedt, Alexander C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:37.734119Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:a9bda7f0fb8217c533d6e4152d0d6422787dc228a3e90d276c44a80ec32cd08f","observation_id":"fc1b2c2d-3bcc-4134-90a3-a7a14aa8d16a","resolution":{"observed_at":"2026-08-07T11:26:37.734119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:37.783760Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:37.783760Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:ee3b4b935b0bcd89215d6d593cde51891be6eaab187f3391c27d65522d50a527","observation_id":"6151acee-2918-4f6e-b934-76869327c956","resolution":{"observed_at":"2026-08-07T11:26:37.783760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T11:26:37.833148Z","title":"Expanding perfor- mance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:37.833148Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:588b2fce25a30b0e5e2fe523f28c58451a923a37fba8eed19352406386935b01","observation_id":"48c87e8e-92d1-41c2-b8f8-6d8ceaadcceb","resolution":{"observed_at":"2026-08-07T11:26:37.833148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:52.572844Z","title":"Med-gemma: Medical vision-language models from google deepmind","venue":null,"work_id":"53a7a85a-a7d8-4fce-9b24-0f13f4e4f7fe","year":null},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:37.890200Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:f11a77d4f4744794c451c33cffa51ec8da71c85a889f999bb41e84cdc2e1aec4","observation_id":"f3a1cad3-6030-4dd9-a9be-c9ebd0a92195","resolution":{"observed_at":"2026-08-07T11:26:52.683020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19666","last_updated":"2024-11-29T12:39:57Z","snapshot_observed_at":"2026-08-02T16:14:35.442247Z","submitted_at":"2024-11-29T12:39:57Z","title":"Multimodal Whole Slide Foundation Model for Pathology","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19666","snapshot_observed_at":"2026-08-07T11:26:37.941927Z","title":"Multimodal whole slide foundation model for pathology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:37.941927Z"},"links":{"cited_paper":"/paper/2411.19666","citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:d6655e3bdff0c3e915b7ddc797d2e57e833437911f1cbbe94aecf8aaf13a10aa","observation_id":"8409f445-d0b5-4c3a-81f9-500b8304525d","resolution":{"observed_at":"2026-08-07T11:26:37.941927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:52.326621Z","title":"Llm-assisted multi-teacher continual learning for visual question an- swering in robotic surgery, 2024","venue":null,"work_id":"05c4dc62-f5a4-46e1-a89e-f3516c30e5b5","year":2024},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:37.995230Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:f61736ff9b2a2e596948996d25060f19a836b0e9fcf7a28c59ecac58fae99187","observation_id":"bf731aed-20fa-401a-b483-f16678ab00ec","resolution":{"observed_at":"2026-08-07T11:26:52.426146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17425","last_updated":"2023-11-06T02:47:51Z","snapshot_observed_at":"2026-07-06T16:25:38.571377Z","submitted_at":"2023-09-29T17:37:29Z","title":"Data Filtering Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17425","snapshot_observed_at":"2026-08-07T11:26:38.041586Z","title":"Data filtering networks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:38.041586Z"},"links":{"cited_paper":"/paper/2309.17425","citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:1061d46cf0efa7341ba0cf4d861d0fe795c47934d79c368f7f5d0418d7d2056e","observation_id":"ba975baa-651d-4a12-8d5d-61eb617d0b4f","resolution":{"observed_at":"2026-08-07T11:26:38.041586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:52.046018Z","title":"Cataract-1k dataset for deep-learning-assisted analysis of cataract surgery videos","venue":null,"work_id":"1cd577bc-a762-46cd-863c-ebfc1690a575","year":null},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:38.098644Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:505a13f602232c46d74d90225b81324289ef254d297de0313bd4e2f513e1af85","observation_id":"8816cfd9-36a0-4356-bf22-927d8f697fe5","resolution":{"observed_at":"2026-08-07T11:26:52.204122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T11:26:38.158761Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:38.158761Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:ed3fc0209ddcffbe079f6ae1fa7c70b21ed82e01aff216dcde30749c59741188","observation_id":"d157c05a-fe16-4a1a-a5cc-1efea293e759","resolution":{"observed_at":"2026-08-07T11:26:38.158761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:51.724198Z","title":"Khan, Sophia Bano, Hani J","venue":null,"work_id":"e1791cb5-b1f8-458d-bae0-94611be92062","year":2024},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:38.204246Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:f8f5afd2a1af38b691ca5b85c24e5be1634366815345183f7f07bf5803c55546","observation_id":"9e3635fb-bf4a-4274-8078-043c29dbf1d7","resolution":{"observed_at":"2026-08-07T11:26:51.879239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:51.444530Z","title":"Lora: Low-rank adaptation of large lan- guage models","venue":null,"work_id":"342cc6a7-6129-4446-8bb2-15578b14c002","year":2022},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:38.254555Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:926a054caae5426ef6d0569b9405779745367d7b2c96c9a2c2fb8a978684a1fc","observation_id":"e5b88ed3-f961-4ec7-ac6b-7447b5c8f650","resolution":{"observed_at":"2026-08-07T11:26:51.600314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:51.130831Z","title":"Ophnet: A large-scale video benchmark for ophthalmic surgical workflow under- standing, 2024","venue":null,"work_id":"52f4caaa-c809-4d53-a5d1-805f21108ab9","year":2024},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:38.300175Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:db36baafef3a47428bf8567eb3ac1b6074c121a86ff62dbd6d76095e7d490cf4","observation_id":"0b7c7212-552c-4c6b-87c7-fe667eed7bff","resolution":{"observed_at":"2026-08-07T11:26:51.281474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T11:26:38.352117Z","title":"Gpt- 4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:38.352117Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:b01b4092b80ca820774f9edd2d1931588a1599eccf167bf72445a604671db04e","observation_id":"72c15374-cf1e-4575-bb0a-cf5fc9cf838c","resolution":{"observed_at":"2026-08-07T11:26:38.352117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:50.854798Z","title":"Le, Yun-Hsuan Sung, Zhen Li, and Tom Duerig","venue":null,"work_id":"734ca7aa-80c3-40f0-8d9f-a3cd2045418e","year":null},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:38.411102Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:0ac16f9dc736a4844c1d9e4d6f200dd813afe981fdd3107eedea2cefb96b252f","observation_id":"1e86a02e-5d78-4ae5-96ec-fce440c2db37","resolution":{"observed_at":"2026-08-07T11:26:50.985437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:50.555149Z","title":"Surgical visual question answering: A new frontier for interpretable computer-assisted intervention","venue":null,"work_id":"c2f7d60f-aa78-40ee-86bf-fa1702bf24a7","year":2022},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:38.469110Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:161c7e038eee438940593aec0610eccff7488358059af75caf6f85568ab433cd","observation_id":"43f07c56-a1ed-44c3-a26a-f1a430b89cc7","resolution":{"observed_at":"2026-08-07T11:26:50.688062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:50.356603Z","title":"Segcol challenge: Semantic segmentation for tools and fold edges in colonoscopy data, 2024","venue":null,"work_id":"7ac98419-4693-4807-a6c3-9929e1f3701f","year":2024},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:38.520615Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:ce8993a15e86696cb029697b039536e6de01dfe6336a602dcc56487e88768237","observation_id":"7f37a43d-772c-4ba9-aa06-1272b97cebfb","resolution":{"observed_at":"2026-08-07T11:26:50.441189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:50.190509Z","title":"Lavanchy, Sanat Ramesh, Diego Dall’Alba, Cris- tians Gonzalez, Paolo Fiorini, Beat P","venue":null,"work_id":"ea5eb15b-81dc-49d5-8a49-f88ea2dc5212","year":null},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:38.588268Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:30faee9de4fefd7044d17206a7190086d116c93ef5eb7d8afedb3d70210c5e7d","observation_id":"2b5e16c2-9cbe-4a6d-bfc5-83c374d70b32","resolution":{"observed_at":"2026-08-07T11:26:50.256864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:50.018575Z","title":"Llava- med: Training a large language-and-vision assistant for biomedicine in one day","venue":null,"work_id":"0f1d39f9-667a-4e41-aec5-3959e1c8fc20","year":2023},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:38.657797Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:0ae4a482bb953fdf0373987ea486f999b58ac4ae65f6f777162b8f369d023fc4","observation_id":"ddec11f9-f134-4240-b184-da74eb21ff06","resolution":{"observed_at":"2026-08-07T11:26:50.087673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:49.815347Z","title":null,"venue":null,"work_id":"3cd8ccfd-d320-42f6-ba87-674405a01c54","year":2023},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:38.701936Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:06338a034773c0810c01c48a63a785db7f79ed68855d9b85027e8644cc4a9073","observation_id":"2e9ac32d-3cfe-4e47-9d2f-6177640ccc9f","resolution":{"observed_at":"2026-08-07T11:26:49.917753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:38.734020Z","title":"Baichuan-omni-1.5 technical re- port","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:38.734020Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:1231d8f5a6d38f3cbbb34bc1414d6175f912faf780841327d73456a2da4a4f23","observation_id":"4f8ac4da-2b74-420d-892c-f15ddde04a2d","resolution":{"observed_at":"2026-08-07T11:26:38.734020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:49.636095Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":"8bd49f0b-c4da-4169-b07d-4069e6c65a6c","year":2023},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:38.783449Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:9d36ad816b816076787c15ef2e9265ea3a1be5d4f7739c3f02264d3ec6fd37fd","observation_id":"ada36601-b84d-4de9-a244-940f00c0b219","resolution":{"observed_at":"2026-08-07T11:26:49.701990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07931","last_updated":"2025-03-11T12:57:43Z","snapshot_observed_at":"2026-08-06T05:55:21.187619Z","submitted_at":"2024-08-15T04:59:12Z","title":"Surgical SAM 2: Real-time Segment Anything in Surgical Video by Efficient Frame Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07931","snapshot_observed_at":"2026-08-07T11:26:38.845546Z","title":"Surgical sam 2: Real-time segment anything in surgical video by efficient frame pruning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:38.845546Z"},"links":{"cited_paper":"/paper/2408.07931","citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:c076fe9adf9ff06b4066ac94a18d2431c5e72f447e2c6ed07e5c7a1ca2a1275e","observation_id":"7975da19-cd78-4200-b52d-6eb0741a478e","resolution":{"observed_at":"2026-08-07T11:26:38.845546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16183","last_updated":"2024-09-24T15:31:49Z","snapshot_observed_at":"2026-08-04T17:30:28.106430Z","submitted_at":"2024-09-24T15:31:49Z","title":"Expert-level vision-language foundation model for real-world radiology and comprehensive evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16183","snapshot_observed_at":"2026-08-07T11:26:38.880120Z","title":"Expert-level vision-language foundation model for real-world radiology and com- prehensive evaluation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:38.880120Z"},"links":{"cited_paper":"/paper/2409.16183","citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:de05d705c43c49c660e6bf5360b329ebf854c03308b04be28648432868fab104","observation_id":"a1fb5cbd-c443-4561-849e-445d06238e5d","resolution":{"observed_at":"2026-08-07T11:26:38.880120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:49.492426Z","title":"Radiology- llama2: Best-in-class large language model for radiol- ogy, 2023","venue":null,"work_id":"52297913-bf04-46f1-acc5-bf49ad35fb71","year":2023},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:38.956975Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:402f8078335ab40ce367df36857f68f4791d8184171ab1cf76f4a0ab5a435614","observation_id":"9fa6782a-ec65-4a5b-a889-3da3744fec18","resolution":{"observed_at":"2026-08-07T11:26:49.543619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:39.016475Z","title":"Surgraw: Multi-agent workflow with chain- of-thought reasoning for surgical intelligence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:39.016475Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:ccc7cd5a9bd7ec6db9c2ce635122e53f17e6e24188be4f4bb5f5897d50379006","observation_id":"7d582b4a-1ddb-4e22-97d6-4a2bd4e79a67","resolution":{"observed_at":"2026-08-07T11:26:39.016475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:49.350110Z","title":"A visual-language foundation model for com- putational pathology","venue":null,"work_id":"1b01cabd-c3a8-4c9a-abad-e462b0fe8d35","year":null},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:39.058926Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:5375b54f030b3e8397edf1639ad78beb1e91708e98af95929115cbc1e5f26f01","observation_id":"b50918d9-6f48-46a4-a744-ac8b86a687b9","resolution":{"observed_at":"2026-08-07T11:26:49.414598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:49.218328Z","title":"A multimodal generative ai copilot for human pathology","venue":null,"work_id":"fdefb8ad-4349-4700-9f91-96c612ff8667","year":2024},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:39.117197Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:a8231f62df49d667c70bd7d8b5cddacc0de77e1dbc88de5e35fa01acec4c9207","observation_id":"da303f06-6ec7-4a33-a44c-65f49b416f34","resolution":{"observed_at":"2026-08-07T11:26:49.274412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:49.109207Z","title":"Nunez Do Rio, Lyn- don da Cruz, Christos Bergeles, Hongyu Chen, Fu- cang Jia, Nikhil KumarTomar, Debesh Jha, Michael A","venue":null,"work_id":"46c38cf5-79f5-47f7-aae3-4f0a3695cd83","year":2020},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:39.189212Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:0126317a63abe7924cef89b7f477871b0cc2180fd6e23aa500bf01245479c4c6","observation_id":"0896b01f-5e43-4777-a983-fbe38842fd8c","resolution":{"observed_at":"2026-08-07T11:26:49.145205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:48.951239Z","title":"Endoscapes2023, a critical view of safety and surgical scene segmentation dataset for laparoscopic cholecys- tectomy, 2024","venue":null,"work_id":"bcdfca37-506a-4aa1-b77d-45eaef026415","year":2024},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:39.236488Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:6dad1a38a799442dfd833c2b78106e78af4a00e19c5cf01637837f98d6473058","observation_id":"7268eb00-2c1f-4f08-8a34-8688a2b4645e","resolution":{"observed_at":"2026-08-07T11:26:49.033908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:48.839346Z","title":"National institutes of health","venue":null,"work_id":"1db6233b-e0bc-416f-aa3e-1942530e8519","year":2025},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:39.291163Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:4404af5fc241faccc2012a74f5da3cb61ae2772c41646349d259955aa820d949","observation_id":"85942856-c5ab-4d19-9385-ecb6ad53eda9","resolution":{"observed_at":"2026-08-07T11:26:48.894996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:48.645331Z","title":"Rendezvous: Attention mechanisms for the recognition of surgical action triplets in endoscopic videos","venue":null,"work_id":"c740d93b-f116-4ff0-a5d7-0486f7758b66","year":2022},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:39.356924Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:202bde42c601a134bf4c72bcd72b2641dbfa64f5e19fa54dfcd98a1ca00ebfaa","observation_id":"4abf143f-baee-4d37-9b79-776c1c3b260b","resolution":{"observed_at":"2026-08-07T11:26:48.730325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:48.490464Z","title":"Cholectrack20: A multi- perspective tracking dataset for surgical tools","venue":null,"work_id":"15519e37-e820-424c-940b-db2e958e8093","year":2025},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:39.426215Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:e4e1c625f1f52396cfed7d1c7f67e558be5c480fb4a0a2ffcf4af4e27e6d626c","observation_id":"74b71bd7-76c1-4abb-947b-34a0ce74fa75","resolution":{"observed_at":"2026-08-07T11:26:48.555498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:48.362384Z","title":"Foundation models in radiology: What, how, why, and why not","venue":null,"work_id":"c44a250b-1169-493f-bed7-3a34fbe22cf5","year":2025},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:39.497293Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:f2347bdff364d50dd16104e25b0862e55ea68f49d4e4660b99257b4317698b0d","observation_id":"998de0c0-c352-4ae4-9003-7e60d681112c","resolution":{"observed_at":"2026-08-07T11:26:48.421835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05599","last_updated":"2025-06-09T11:44:18Z","snapshot_observed_at":"2026-08-09T12:50:50.767642Z","submitted_at":"2025-04-08T01:19:20Z","title":"Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05599","snapshot_observed_at":"2026-08-07T11:26:39.566577Z","title":"Skywork r1v: Pioneering multi- modal reasoning with chain-of-thought","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:39.566577Z"},"links":{"cited_paper":"/paper/2504.05599","citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:59bdc3999a9b850a270091bdffc3e1a769875c5ccf8dfa8b3b83370f9e021add","observation_id":"f64cea09-1498-41e3-a433-a442078a277c","resolution":{"observed_at":"2026-08-07T11:26:39.566577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:48.244980Z","title":"Competence-based curriculum learning for neural ma- chine translation","venue":null,"work_id":"553d050b-c1ed-42ea-90db-2c933fa9d244","year":2020},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:39.617787Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:d0eb2cc0913c4d83c6776ab762da4253baf104f890a11ce6c9f9249714457222","observation_id":"348aa646-bc5a-43c1-ae92-3b9cee713bf7","resolution":{"observed_at":"2026-08-07T11:26:48.298004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:48.096627Z","title":"Sar-rarp50: Segmentation of surgical in- strumentation and action recognition on robot-assisted radical prostatectomy challenge, 2024","venue":null,"work_id":"de634df7-6522-4848-b89e-cabb9a8c3d0b","year":2024},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:39.620043Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:e1dd9bde8a2d04bab9e78b66e1712b3119c2b70bf244e2b59e5f82e9578a2607","observation_id":"ccfb18a3-e4cb-4cea-81c8-92f8e8689768","resolution":{"observed_at":"2026-08-07T11:26:48.164714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:47.966720Z","title":"Learning transferable visual models from natural lan- guage supervision","venue":null,"work_id":"1480f3e9-44df-4b6c-a2a4-f2cb508fce36","year":2021},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:39.658587Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:50c10f9f7539e7e49a98265d03802b70f801dd794ae61481bab37ae112bcbcb3","observation_id":"9661da0e-b4a7-4ba5-94a7-2ff49fcff1f0","resolution":{"observed_at":"2026-08-07T11:26:48.035489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:47.751469Z","title":"Rios, M.A","venue":null,"work_id":"643b3e76-81cb-43a1-be1a-89469dcb4d94","year":2023},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:39.730306Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:b6a670e33469cfb9b7db8f3d541a37764cac29da7945b69168b2eb6c616d96bd","observation_id":"c0be85b4-7d9c-42e6-8137-eeb4f147380d","resolution":{"observed_at":"2026-08-07T11:26:47.874836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:47.537729Z","title":"Surgical-VQA: Visual question answering in surgical scenes using trans- former","venue":null,"work_id":"ccec263c-ec1f-4594-aec0-66e59802bff6","year":2022},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:39.813904Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:9f2f5530314546a82130b76a172cf61782f377c3f72f06fa220441fb5c2658f7","observation_id":"f349c760-3b2a-47e3-94a3-234259a019f1","resolution":{"observed_at":"2026-08-07T11:26:47.665366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:47.433430Z","title":"Surgicalgpt: end-to-end language-vision gpt for visual question answering in surgery","venue":null,"work_id":"ddce48f0-d43e-4097-8960-79706ad24c07","year":2023},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:39.910737Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:26e12ccdb65dcfb66f2a1d6f4a2ef1be96c50c8da5c3e1cf20172affa1c84185","observation_id":"64318212-7e97-408e-bde5-2478ea61c927","resolution":{"observed_at":"2026-08-07T11:26:47.482875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:47.241386Z","title":"Think step by step: Chain-of-gesture prompting for error detection in robotic surgical videos","venue":null,"work_id":"1dc657d9-c41b-4608-9d8a-57a1d4aaca37","year":2024},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:40.020386Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:48521601bea5880c6c00a765736f4fd0d95318a06d3eac0ad5ff307d47f16e84","observation_id":"e126565e-efbe-4488-8df9-4ff007250a4e","resolution":{"observed_at":"2026-08-07T11:26:47.308989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T11:26:40.140183Z","title":"Gemini: a family of highly capable multi- modal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:40.140183Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:9f2069a9ffbc89bb465dcd5d94438fee6279faf5232bf5ffd9854fe5298a9c3f","observation_id":"997de449-0da0-4a15-8cdc-c77b13a30317","resolution":{"observed_at":"2026-08-07T11:26:40.140183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-07T11:26:40.251573Z","title":"Gemma 3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:40.251573Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:8b7dd2fbad8209219b8231c5bc23ca8509bb0875f221985780f859e7f1e116be","observation_id":"6d1e4581-143d-4903-8455-9375e40445d9","resolution":{"observed_at":"2026-08-07T11:26:40.251573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-08-09T09:48:45.884814Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-07T11:26:40.398166Z","title":"Kimi-vl technical re- port","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:40.398166Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:0b037ce198d0f02acb8317ddc1e53eab77abe2275050ce688eede7df47399179","observation_id":"5a28b9b2-abfa-4019-aeb2-bd20e66ba847","resolution":{"observed_at":"2026-08-07T11:26:40.398166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:47.059979Z","title":"Minicpm-o 2.6: A gpt- 4o level mllm for vision, speech, and multimodal live streaming on your phone, 2025","venue":null,"work_id":"cb3f2bad-bf9f-42c7-9f45-c9d44378a8c1","year":2025},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:40.521399Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:f62fc8f68f2c577a1dfd0f72e7812e9770245ece2d80492926efdf40a22867b8","observation_id":"3c09be85-8ae3-45d5-8f53-fa0ac36d52bd","resolution":{"observed_at":"2026-08-07T11:26:47.188040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T11:26:40.611565Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:40.611565Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:f4f206a7dc200cc486ce426cdd78df6a9684f726fa0604d541ec9ee151d8cd43","observation_id":"46da65d6-b462-495e-999b-06483925c7ee","resolution":{"observed_at":"2026-08-07T11:26:40.611565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-07T11:26:40.707113Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic un- derstanding, localization, and dense features","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:40.707113Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:9e243d3cffb7eabae1c054c6d15c0ffd851f00a6562b36e9bca77ee51f809b52","observation_id":"8e2068ef-3aab-4765-9979-53bdc9d23ce9","resolution":{"observed_at":"2026-08-07T11:26:40.707113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:46.998798Z","title":"Twinanda, Sherif Shehata, Didier Mutter, Jacques Marescaux, Michel De Mathelin, and Nicolas Padoy","venue":null,"work_id":"bc235dc5-21bb-4989-be68-01906af56885","year":2016},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:40.798831Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:bd69258488477ffafd49aace13fef7364dd607724be188784535dc32d508180c","observation_id":"9a28e57e-f308-4adb-bac1-9c28549b9ffd","resolution":{"observed_at":"2026-08-07T11:26:47.055538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16652","last_updated":"2025-01-28T02:35:02Z","snapshot_observed_at":"2026-07-06T20:27:09.296190Z","submitted_at":"2025-01-28T02:35:02Z","title":"Molecular-driven Foundation Model for Oncologic Pathology","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16652","snapshot_observed_at":"2026-08-07T11:26:40.962073Z","title":"Molecular-driven foundation model for oncologic pathology","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:40.962073Z"},"links":{"cited_paper":"/paper/2501.16652","citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:b7bf68751c6e488f1a24d82116249bca3dc6f06270431e077992e5f219ee5eb2","observation_id":"dbdd323f-ac16-470b-b460-f4b1e75f49fe","resolution":{"observed_at":"2026-08-07T11:26:40.962073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:46.885215Z","title":"A foundation model for clinical- grade computational pathology and rare cancers detec- tion","venue":null,"work_id":"09020658-6cb7-4d1f-8071-b9633cda1b9e","year":2024},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:41.082301Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:92dc9da9c137a2cc46b677bd953a51304a69dc205297103d33152807e2efb58d","observation_id":"9518bd0a-af75-4f71-b35b-9ade359d7634","resolution":{"observed_at":"2026-08-07T11:26:46.952111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:46.726155Z","title":"Copesd: A multi-level surgical motion dataset for training large vision-language models to co- pilot endoscopic submucosal dissection, 2024","venue":null,"work_id":"03157c19-eb0e-4b42-9f9b-7f08547ca40f","year":2024},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:41.189380Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:eae829e413b7b4bc519d56fa8a00de2372272e3b04ea69d4e01dc6c19a0ba912","observation_id":"44826df3-3d5f-476b-928c-6eb3a2d710fa","resolution":{"observed_at":"2026-08-07T11:26:46.785565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11347","last_updated":"2025-03-15T02:35:48Z","snapshot_observed_at":"2026-07-06T20:23:18.251842Z","submitted_at":"2025-01-20T09:12:06Z","title":"EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11347","snapshot_observed_at":"2026-08-07T11:26:41.342636Z","title":"Endochat: Grounded multimodal large language model for endoscopic surgery","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:41.342636Z"},"links":{"cited_paper":"/paper/2501.11347","citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:24c08704e48a229ca94edf73041972096ac499c5c3a3a8a011fd014eab7ecb9a","observation_id":"6bd54c96-1e80-4e08-98e4-00190f63cb7d","resolution":{"observed_at":"2026-08-07T11:26:41.342636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T11:26:41.478010Z","title":"Qwen2-vl: Enhancing vision- language model’s perception of the world at any reso- lution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:41.478010Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:0a2eb101c5feb5c87e7384e57c3fe3f7cf789c6e934aa9c8c8df5ecb5b9b5778","observation_id":"dc6f7719-a6cf-4710-a705-22fdb94db794","resolution":{"observed_at":"2026-08-07T11:26:41.478010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:46.537826Z","title":"A pathology foundation model for cancer diagnosis and prognosis prediction","venue":null,"work_id":"4f27b4d1-f185-4827-a6b9-39aaa604fa18","year":2024},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:41.586491Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:5d1f90653804dd406273c92002113ece4f6d93b8d7ca8b54564d431c68d7c045","observation_id":"84b5f96f-d5eb-4e4a-9609-597e91f0fd1b","resolution":{"observed_at":"2026-08-07T11:26:46.629419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:46.374327Z","title":"Auto- laparo: A new dataset of integrated multi-tasks for image-guided surgical automation in laparoscopic hys- terectomy, 2022","venue":null,"work_id":"4aad6607-465a-488c-b30e-6e954c1885af","year":2022},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:41.719421Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:544ad6831c9c7703ba23290142e5e44b77f9907f39521ad5a8e49199805a488e","observation_id":"0a840cea-e449-4a49-9cb7-134eb8dc46f9","resolution":{"observed_at":"2026-08-07T11:26:46.447202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02463","last_updated":"2023-11-16T12:38:46Z","snapshot_observed_at":"2026-08-08T04:57:05.131540Z","submitted_at":"2023-08-04T17:00:38Z","title":"Towards Generalist Foundation Model for Radiology by Leveraging Web-scale 2D&3D Medical Data","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02463","snapshot_observed_at":"2026-08-07T11:26:41.820666Z","title":"Towards generalist foundation model for radiology by leveraging web-scale 2d&3d medical data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:41.820666Z"},"links":{"cited_paper":"/paper/2308.02463","citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:7979fa50bce49cb36f0719d522ea2ae8262d822022bf9050b570224f78a06634","observation_id":"0b3d9e2c-71b3-461d-9504-3d16f3746b14","resolution":{"observed_at":"2026-08-07T11:26:41.820666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-07T11:26:41.924257Z","title":"Deepseek- vl2: Mixture-of-experts vision-language models for advanced multimodal understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:41.924257Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:69be5bd2a2aa77da6032e5dde3fa34d45f00c830b58cd88d25923890d24a19db","observation_id":"2d594965-ff03-42c5-ba27-4ad8dbb124c4","resolution":{"observed_at":"2026-08-07T11:26:41.924257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T11:26:42.093921Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:42.093921Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:0894d95b12b0e1f4de03ba07b2ea7b5ce7f13e38067629eb01e3052c4cba2ce6","observation_id":"0f7a165f-6b33-4b4a-8d28-4283ce774e65","resolution":{"observed_at":"2026-08-07T11:26:42.093921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T11:26:42.207450Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:42.207450Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:e54930d914c4a0a6ef83d2a88ec8b0ee4c97a5bdb246221a9106ee0a71577438","observation_id":"4cb83604-b9c2-4455-aad2-ecbef0664fc1","resolution":{"observed_at":"2026-08-07T11:26:42.207450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-07T11:26:42.342936Z","title":"mplug-owl3: Towards long image-sequence under- standing in multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:42.342936Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:5d2b1a03b0b3be092350b70e52dc0b76513fcf9ab3c099cacc90ac1c15608e70","observation_id":"fd352e31-d82c-4085-874a-5d2512ec83de","resolution":{"observed_at":"2026-08-07T11:26:42.342936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15220","last_updated":"2025-06-16T19:07:50Z","snapshot_observed_at":"2026-07-06T15:59:30.956483Z","submitted_at":"2023-07-27T22:38:12Z","title":"Learning Multi-modal Representations by Watching Hundreds of Surgical Video Lectures","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15220","snapshot_observed_at":"2026-08-07T11:26:42.488662Z","title":"Learning multi-modal representations by watching hundreds of surgical video lectures","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:42.488662Z"},"links":{"cited_paper":"/paper/2307.15220","citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:502afa7f2423692dad912a3b5bd63a0775c5a3ed60ed9d83d6822fbf12782545","observation_id":"d20ba40d-23a4-455e-afc3-51a00dc46498","resolution":{"observed_at":"2026-08-07T11:26:42.488662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:46.239958Z","title":"Advanc- ing surgical vqa with scene graph knowledge","venue":null,"work_id":"4afe82ec-fdd6-4e1b-8854-10ad04e74a34","year":2024},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:42.587415Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:f1b781576bd1d1dfe98bdfc7d1860340d81abab2597a53323fe61157ce721e7d","observation_id":"b81bb05c-8a99-4764-94ac-9532dc5dba02","resolution":{"observed_at":"2026-08-07T11:26:46.285322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:46.086040Z","title":"Cognition guided human-object re- lationship detection","venue":null,"work_id":"f7996fc1-80c6-4e79-8bc0-338c0d163564","year":2023},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:42.733124Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:b207858b6b795dcd906f0d7cbf0229709b233a9259919709aac83851d8fb5f06","observation_id":"f4c384da-9b6f-4b37-b5da-d662d749e87c","resolution":{"observed_at":"2026-08-07T11:26:46.144392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:45.951564Z","title":"Sigmoid loss for language image pre- training","venue":null,"work_id":"56e647b6-71ca-40cb-997b-0b1a9a9b927d","year":2023},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:42.890603Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:26645516cf75a7873c94c31cfeef3c2c5935c5ab9ef4416769addaa71f2f0f26","observation_id":"a5ce6b65-fbcd-4a22-bbc6-7a1523932501","resolution":{"observed_at":"2026-08-07T11:26:46.033792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09596","last_updated":"2024-12-12T18:58:30Z","snapshot_observed_at":"2026-08-04T06:52:46.954992Z","submitted_at":"2024-12-12T18:58:30Z","title":"InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09596","snapshot_observed_at":"2026-08-07T11:26:43.022715Z","title":"Internlm-xcomposer2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:43.022715Z"},"links":{"cited_paper":"/paper/2412.09596","citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:fcef20fc89613cbfe6523955e523acbc7614cabdfb236d3d2e76c058d636e02b","observation_id":"e7381476-3277-4121-a530-b252841a80b1","resolution":{"observed_at":"2026-08-07T11:26:43.022715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T11:26:43.138721Z","title":"Long con- text transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:43.138721Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:1287b44d5276ab33121bdab7d768048f3fd51c9105996e8c7f502ffacaad043d","observation_id":"b0a8dfb3-6cc0-40ee-a393-04b366ffd805","resolution":{"observed_at":"2026-08-07T11:26:43.138721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:45.846017Z","title":"Knowledge-enhanced visual-language pre-training on chest radiology images.Nature Commu- nications, 14(1):4542, 2023","venue":null,"work_id":"83800b09-a327-4179-bc77-ec1c843bfd2f","year":2023},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:43.254417Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:748a9fc2506cc65c05e0cd2be8a10e2a8e135985a6a29fb274e4e945288d870d","observation_id":"09b1edc2-b9e3-47bb-bfe4-8544bf68d961","resolution":{"observed_at":"2026-08-07T11:26:45.912075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:45.714280Z","title":"Large-scale long-tailed disease diagnosis on radiology images","venue":null,"work_id":"8da8294d-560b-4646-b0fa-ac9daa0381ff","year":2024},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:43.357614Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:299087e77122ed59681fc3ed04ed1eab7bbdd32a094b78c0182176a8a7308bf8","observation_id":"f5aa36f7-b1ca-45f4-a42b-58e1f7303da1","resolution":{"observed_at":"2026-08-07T11:26:45.758279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T11:26:43.461381Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multi- modal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:43.461381Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:e490cc1b9534de9eae6575a39b8aace575675706037e838be1308c7f87705af9","observation_id":"ee514e3a-760c-49f7-8dfb-3f8be28bc8ec","resolution":{"observed_at":"2026-08-07T11:26:43.461381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:45.574732Z","title":"The demonstrated step is gastrojejunal defect closure, and during the step, the surgeon is closing the orifice left by the stapler, creating the gastrojejunostomy","venue":null,"work_id":"cd10021d-5a4c-4c37-8aa1-b61404f8ec87","year":null},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:43.557862Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:21b25850abaa7d1b37289a386b858d1d57bcc8f2250988e1c63561a79f84edeb","observation_id":"662e2651-e10d-4bae-8b15-ee495186f028","resolution":{"observed_at":"2026-08-07T11:26:45.633162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:45.469753Z","title":null,"venue":null,"work_id":"a980ae67-6166-4060-a4f9-24200d1ab4f4","year":null},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:43.600988Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:f29d21c437237e7454b1476cf245213a9b2d6289c784316267b85d5357de44bc","observation_id":"322359df-0745-4d0a-b14a-3a1720686582","resolution":{"observed_at":"2026-08-07T11:26:45.540157Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:45.363787Z","title":null,"venue":null,"work_id":"a0e99583-c4bf-4026-9082-aab7c2ec97eb","year":null},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:43.661002Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:f1b07d49b33e8462997a394672516c625f2d24851b871a6326a0c4a6c4c97328","observation_id":"19dd6fe9-d7ce-4153-90b9-96e24f698e31","resolution":{"observed_at":"2026-08-07T11:26:45.408755Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:45.237695Z","title":"LLM Decoder V V V V V V TTTT Multimodal Fusion Vision Encoder Text Tokenizer �� �푀 �� �� 1","venue":null,"work_id":"60e23a40-76f9-4ad6-b6e2-36cb149a649c","year":null},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:43.722505Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:a745c2d102e75e20fa1a092e05fe6966fd04192bb920b4c5bdd12a716cbd4906","observation_id":"09f2ff85-34ee-4589-90d1-b371c2a4430c","resolution":{"observed_at":"2026-08-07T11:26:45.304789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:45.105266Z","title":null,"venue":null,"work_id":"bf12a085-3cc8-43f6-bfd3-20e8663bffc6","year":null},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:43.771751Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:93fb8a0ca09a64999b7b17358224b9e724aa651d8226c15453a1f7558d18e1d7","observation_id":"2f842d4a-97bb-4980-b285-7654b121a2df","resolution":{"observed_at":"2026-08-07T11:26:45.183191Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:45.002280Z","title":null,"venue":null,"work_id":"5ec02a73-0b10-4a46-90b1-ae8caaa45dd9","year":null},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:43.819490Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:eaf63c9cf06f3b53afff6360f6871321ff47935fb05eb0af00d13777ad0a9a5d","observation_id":"c78ae143-3429-4f59-9ac1-1f8da21575dc","resolution":{"observed_at":"2026-08-07T11:26:45.042004Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:44.843275Z","title":"Overall illustration of proposed SurgVLM","venue":null,"work_id":"bb487b6a-1a9d-4aee-ae07-f41d52db55f2","year":null},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:43.884355Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:57342e645db0c33579fd0c1834aaf8f45a2702af39df865c3d1dde52300a01b2","observation_id":"73e7d5eb-ba27-476c-bfd4-13010016698e","resolution":{"observed_at":"2026-08-07T11:26:44.935565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:44.747075Z","title":null,"venue":null,"work_id":"68cde264-7569-4a22-831f-5fee4e06249c","year":null},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:43.941789Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:e1780589b35fefd7e765105e558822caf1ab92e8a7de39346ba7acae5a84612e","observation_id":"4ba1e0a0-a4da-46b9-a1f6-e636befa89e9","resolution":{"observed_at":"2026-08-07T11:26:44.794403Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:44.602091Z","title":null,"venue":null,"work_id":"ba6caf68-9bbc-49cb-8408-17e756e7e2fc","year":null},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:43.981065Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:b975935f026e68db1b84044032d4702669ddaee4690af0253fc2c48e3a0e0d85","observation_id":"1e56be53-a7d8-45c5-ab9e-e085d6a491ec","resolution":{"observed_at":"2026-08-07T11:26:44.651800Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:44.401476Z","title":"present” vs. “absent","venue":null,"work_id":"c705fdde-0ac3-4542-8ff0-d45ec3513e45","year":2017},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:44.013878Z"},"links":{"citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:b1d8b0cc2578d18d59040555678590e5d677af274782f81decfc8f3a6146af17","observation_id":"214ffcbe-8112-4362-9033-9ef928783ac0","resolution":{"observed_at":"2026-08-07T11:26:44.436995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence"},"reference_resolution":{"displayed":88,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":43},"total_outbound_references":88},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 88 of 88 outbound references and 9 inbound Pith citation observations for arXiv:2506.02555."}