Pith. sign in

Paper Citation Record · LEDGER

EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery

As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2501.11347.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2501.11347 v2

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 9 of 9 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 9 of 9 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T15:25:30.253488Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-25T05:25:23.535112Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 7c7d979b-424c-4bd3-bf5f-8563f1b1bf00 · inbound

EndoVLA: Dual-Phase Vision-Language-Action Model for Autonomous Tracking in Endoscopy cites this paper.

EndoVLA: Dual-Phase Vision-Language-Action Model for Autonomous Tracking in Endoscopy EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T15:25:30.253488Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:25:30.253488Z digest=sha256:d902df89781f75e11e67544f6afc07e0f1c19d475daf5ae8ba9bbe2b49d0eab2

Observation 6bd54c96-1e80-4e08-98e4-00190f63cb7d · inbound

SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence cites this paper.

SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:41.342636Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:26:41.342636Z digest=sha256:24c08704e48a229ca94edf73041972096ac499c5c3a3a8a011fd014eab7ecb9a

Observation 181ecb5c-c2fb-4d0a-ac6f-ae1a0956997b · inbound

SurgBench: A Unified Large-Scale Benchmark for Surgical Video Analysis cites this paper.

SurgBench: A Unified Large-Scale Benchmark for Surgical Video Analysis EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T05:36:21.572033Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:36:21.572033Z digest=sha256:971c1354884756287c344618a0ce93931138d9aeaabe390247027c910e0135dd

Observation 5cf0f6de-075d-481a-aa46-24909667bbcb · inbound

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning cites this paper.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.627569Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.627569Z digest=sha256:8c0e46c6e4feccbcbe07e284928ca31e6bbec4e3eb3905562e7269a1112b7985

Observation 427d18a1-4811-4b43-9830-6b8013f09691 · inbound

BleedOrigin: Dynamic Bleeding Source Localization in Endoscopic Submucosal Dissection via Dual-Stage Detection and Tracking cites this paper.

BleedOrigin: Dynamic Bleeding Source Localization in Endoscopic Submucosal Dissection via Dual-Stage Detection and Tracking EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-06T15:46:27.476601Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:46:27.476601Z digest=sha256:e1272df8404257b8ccdfaf9073f545f41dd38eddd535003d1429bd459f63a4b8

Observation 2d7aaed5-1d94-4742-95c3-126c6f8eaea2 · inbound

MedGRPO: Multi-Task Reinforcement Learning for Heterogeneous Medical Video Understanding cites this paper.

MedGRPO: Multi-Task Reinforcement Learning for Heterogeneous Medical Video Understanding EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery

Reference 39

Resolution
verified exact
arxiv_id, observed 2026-05-17T00:18:43.971741Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-17T00:14:56.268778Z digest=sha256:5b9c2426a243dfd23d9cc8af70b576436948134f9fd6752861ff4b1f383bb967

Observation c9e2dec7-d286-487e-a65e-1e2ec8f57889 · inbound

Hi-GaTA: Hierarchical Gated Temporal Aggregation Adapter for Surgical Video Report Generation cites this paper.

Hi-GaTA: Hierarchical Gated Temporal Aggregation Adapter for Surgical Video Report Generation EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery

Reference 24

Resolution
verified exact
arxiv_id, observed 2026-05-13T07:02:27.067283Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-13T07:01:52.336836Z digest=sha256:017eaa400a8a5e546e8caae474080193eb289a64da9abbec66537599f726fb76

Observation 245ae0ff-a981-4c7b-90b5-4c15bbada563 · inbound

Hi-GaTA: Hierarchical Gated Temporal Aggregation Adapter for Surgical Video Report Generation cites this paper.

Hi-GaTA: Hierarchical Gated Temporal Aggregation Adapter for Surgical Video Report Generation EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery

Reference 26

Resolution
verified exact
arxiv_id, observed 2026-05-20T21:49:05.096800Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-20T21:48:50.087461Z digest=sha256:c7b8e31061fc7caa857c5ecf19e9fb8b3b626324373ea88c7be417cc62425ad5

Observation 3c5070fc-aa2f-49c6-9172-2a780874cc4e · inbound

RoboSurg-VQA: A Multimodal Benchmark for Surgical Segmentation-Aware Visual Question Answering cites this paper.

RoboSurg-VQA: A Multimodal Benchmark for Surgical Segmentation-Aware Visual Question Answering EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-05-25T05:25:23.538041Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-25T05:22:44.481868Z digest=sha256:fef6538a4dc9e956980dade8c864d3a2024cd8b262c02f240bfb76c255153824